maskinlæring

Utgir datasett for norsk talegjenkjenning med fri lisens

– Dette betyr at teksting i sanntid snart kan gjøres automatisk.

Lydopptak fra Stortinget gir grunnlag for bedre algoritmer for talegjenkjenning.
Lydopptak fra Stortinget gir grunnlag for bedre algoritmer for talegjenkjenning. Illustrasjonsfoto: Audun Braastad, NTB

Språkbanken i Nasjonalbiblioteket har transkribert en større mengde lydopptak. Det dreier seg om 140 timer med tale, som består av 65.000 setninger og 1,2 millioner ord.

Datasettet deler de nå under en fri lisens, helt uten begrensninger. Dette innebærer at teksting i sanntid snart vil kunne gjøres automatisk, ifølge en pressemelding tirsdag.

– Slik talegjenkjenning vil være til stor hjelp for folk med nedsatt hørsel og gjøre det lettere å skrive referat og ta notater, sier Per Erik Solberg, språkteknolog ved Nasjonalbiblioteket.

Det såkalte Stortingskorpuset har bakgrunn i lydopptak gjort i Stortinget under plenumsmøter i 2017 og 2018. Disse er transkribert og deretter manuelt sjekket og korrekturlest av kvalifiserte lingvister og filologer, blir det opplyst.

Mat til algoritmer

Datasettet, dokumentasjon og mer informasjon finner du på denne siden. Ressursen er utgitt under en Creative Commons-lisens kalt CC-ZERO, noe som innebærer fri bruk, også uten navngivelse.

Solberg forklarer at stortingsmøtene er spesielt godt egnet til formålet. Det skyldes blant annet at det foreligger detaljerte referater, samt opptak med mye spontan tale – også på en rekke forskjellige dialekter. I tillegg snakker ikke folk så ofte i munnen på hverandre.

Det siste er en fordel når datasettet skal brukes til å trene algoritmer, som i motsatt fall kan bli forvirret. Nasjonalbibliotekets språkteknolog har store forventninger til hva korpuset kan medføre av forbedringer i tiden som kommer.

– Tenk deg at du kan kjøre lyden fra et foredrag gjennom en talegjenkjenner på PC-en din og få en god, norsk transkripsjon av hva som blir sagt. Eller se for deg at du ser en norskspråklig video på nettet og kan få en god, automatisk undertekst. Dette er ikke mulig i dag, men det vil kanskje være en realitet i en ikke altfor fjern framtid, sier Solberg i en pressemelding.

Bedre på støy og dialekt

Forskere i Telenor har allerede tatt i bruk datasettet til å trene opp talegjenkjenningsystemer i norsk.

– Datasettet er et viktig bidrag som gjør det lettere for oss å modellere norsk tekst og tale. Ved hjelp av det blir algoritmene våre mye bedre på å håndtere realistiske talesituasjoner med støy, avbrudd og dialektbruk, uttaler Pablo Ortiz, som er seniorforsker ved Telenor Research.

Powered by Labrador CMS