kunstig intelligens

Knekker dialektkoden for språkmodeller

Nasjonalbiblioteket har tatt et langt steg i å knekke en av de vanskeligste kodene for bruk av tale-til-tekst-modeller i Norge: Dialekt-mangfoldet.

– Dette er et viktig arbeid for å sikre at kunstige intelligenser, språkmodeller og redskap for alt fra helse til utdanning fungerer på norsk i framtida, sier nasjonalbibliotekar Aslak Sira Myhre.
– Dette er et viktig arbeid for å sikre at kunstige intelligenser, språkmodeller og redskap for alt fra helse til utdanning fungerer på norsk i framtida, sier nasjonalbibliotekar Aslak Sira Myhre.

Alle som har testet automatisk transkribering av sognemål, eller å snakke med en automatisk telefonsvarer på klingende Setesdøl har opplevd det:

Selv de beste språkmodellene for tale-til-tekst har en klar bias til fordel for Oslo-mål.

Nå har Nasjonalbiblioteket tatt i bruk sitt omfattende arkiv med dialekt-materiale til å trene modellen NB Whisper, som er bygget på OpenAIs Whisper-modell. Modellen skal være bedre til å forstå norske dialekter enn noen annen modell på markedet.

Det melder biblioteket selv i en pressemelding.

Vanskeligere på små språk

Absolutt alle digitale løsninger som er basert på at du snakker til den, krever en modell for automatisk tale-gjenkjenning (ASR) i bunn.

Et vanlig utfordring i utviklingen av disse modellene er å finne nok materiale til å trene dem. Derfor er de gjerne mer effektive på store språk som engelsk, men sliter med små språk og dialekter der materialet er begrenset.

Derfor har Nasjonalbiblioteket gjort sitt for å løfte norsk språk og dialektmangfold. De har også forsøkt å trene en versjon av modellen på nordsamisk, men materialet er for begrenset til å få til en effektiv modell.

Allerede i 2019 kunne Microsoft lansere sin talegjenkjenning på norsk før alle de andre nord-europeiske språkene, takket være bibliotekets språkbank.

Grunnlaget er digitaliseringen av et omfattende arkiv, blant annet fra radio, TV og taler på Stortinget.

Nasjonalbiblioteket har digitalisert store mengder lydmaterialet, blant annet ved hjel av denne, Stüder A800 MK3. Foto: Maja Atterstig, Nasjonalbiblioteket
Nasjonalbiblioteket har digitalisert store mengder lydmaterialet, blant annet ved hjel av denne, Stüder A800 MK3.

Tilgjengelig i Beta-versjon

Nå kan du ta i bruk den nye Whispermodellen i betaversjon.

− Vi deler alt vi gjør. Dermed blir de ressursene vi lager en plattform for utvikling av norsk språk og maskinenes verden. Språkmodellen er langt fra feilfri, men den er bedre rusta til å forstå norsk tale og dialekter enn andre programmer som er tilgjengelige, sier nasjonalbibliotekar Aslak Sira Myhre i pressemeldingen.

NB Whisper er trent til å forstå norsk tale, og omgjøre den til tekst på standardisert bokmål eller nynorsk.

Modeller for tale til tekst kan bli en viktig del av mange større modeller fremover.

Ulike språkmodeller

Store språkmodeller (LLM) ble allemannseie høsten 2022 med lanseringen av ChatGPT, men ulike språkmodeller har vært en viktig del av IT-utvikling i mange år.

For eksempel er Norges kanskje mest kjente Chatbot, Kommune-Kari, basert på en modell for naturlig språkforståelse (NLU). NLU forstår meningen i en tekst, og kan trenes til å koble en mening til et bestemt svar.

NLG (Natural Language Generation) er i stand til å selv konstruere setninger basert på data maskinen har. Disse to teknologiene er grunnleggende for tradisjonelle chatboter.

En LLM av typen OpenAI har utviklet (ChatGPT) er trent på enorme mengder tekst gjennom såkalt dyp maskinlæring, og bruker svært mange parametere for å finne ut hva som er sannsynlig neste ord eller setning i en tekst-rekke.

Absolutt alle digitale løsninger som er basert på at du snakker til modellen, krever en modell for automatisk tale-gjenkjenning (ASR) i bunn.

Mange bruksområder

Den enkleste bruken av denne typen modeller er til ren transkribering. Det brukes allerede av alt fra journalister, advokater og helsepersonell til studenter, og Nasjonalbiblioteket selv.

– Vi har et håp om å bruke denne modellen på våre egne arkiv. Om vi for eksempel kan transkribere radioarkivet, vil det bli søkbart. Dermed blir det åpent på en helt annen måte for folk, sier Sira Myhre.

Men slike modeller er også avgjørende for at mer komplekse løsninger skal kunne bruke tale som input, for en enda mer naturlig omgang med digitale løsninger.

Tidligere i år begynte utrulling av ChatGPT støtte til Teams, som blant annet innebar automatisk teksting av møter, automatiserte møtereferater og forslag oppfølgingspunkter. Løsningen hadde ikke vært mulig uten tale-til-tekst.

– Veldig lovende resultater

Et annet eksempel er den norsk-utviklede simulatoren for realistisk trening på nødsituasjoner, der bedre dialektforståelse nettopp var blant problemene som måtte løses.

Selskapet bak, det vestlandsbaserte Sklls, har lenge fulgt arbeidet på Nasjonalbiblioteket.

Arbeidet Nasjonalbiblioteket har gjort kommer hele det norske teknologimiljøet til nytte, mener Håkon Hapnes Strand, teknologisjef i Sklls. Foto: Sklls
Arbeidet Nasjonalbiblioteket har gjort kommer hele det norske teknologimiljøet til nytte, mener Håkon Hapnes Strand, teknologisjef i Sklls.

– Den nye språkmodellen som Nasjonalbiblioteket nå har trent på sine datasett gir veldig lovende resultater, og det kan godt hende dette er noe vi kommer til å ta i bruk når den kommer i produksjonsklar versjon, sier Håkon Hapnes Strand, teknologisjef i Sklls, til Digi.

Selskapet har som mange andre som jobber med ulike former for språkmodeller sett at små språk blir nedprioritert av teknologikjempene. Derfor er arbeidet fra Nasjonalbiblioteket nyttig.

– Dette er arbeid som kommer hele det det norske teknologimiljøet til nytte siden alt blir gjort åpent tilgjengelig. Vi har blant annet brukt flere av datasettene Nasjonalbiblioteket har offentliggjort til å trene våre egne norske språkmodeller, sier Hapnes Strand.

Sikrer språket for fremtiden

For Nasjonalbiblioteket handler arbeidet ikke bare om å hjelpe utviklerne, men om at teknologiutviklingen i den store verden, også skal komme nordmenn til gode.

– Dette er et viktig arbeid for å sikre at kunstige intelligenser, språkmodeller og redskap for alt fra helse til utdanning fungerer på norsk i framtida, sier Sira Myhre.

Powered by Labrador CMS