kunstig intelligens

Maskinlæring og hallusinering: − Det er egentlig en drømmemaskin

Hvorfor finner maskinlæringsmodellen opp tekst som ikke har noen sammenheng med input? Årsakene til hallusinering kan hjelpe oss å forstå modellene bedre.

Hva skjer når man setter på opptak i et tomt møterom? Ganske mye hvis man bruker generativ kunstig intelligens til å transkribere opptaket.
Hva skjer når man setter på opptak i et tomt møterom? Ganske mye hvis man bruker generativ kunstig intelligens til å transkribere opptaket.

− Er det greit for deg om jeg setter på opptak på mobilen?

Slik starter journalisten fra Digi intervjuet – som vanlig.

Hun trykker på opptaksknappen og legger telefonen på bordet. Så er den glemt. Etter intervjuet går hun ut for å ta noen bilder.

I 15 minutter ligger mobilen igjen i et tomt rom – mens den fortsetter å ta opp lyd.

Tilbake på kontoret går lydfila inn i løsningen for automatisk transkribering. Når resultatet ligger klart, mangler det slett ikke tekst for de siste 15 minuttene av opptaket.

− Jeg elsker deg. Jeg elsker deg. Jeg møtte henne til lunsj i Sør-Korea. Jeg elsker deg, har modellen skrevet. Side opp og side ned fortsetter det på samme måte.

Journalisten går tilbake til opptaket, lytter, skrur opp lyden til maks, lytter igjen. Bortsett fra litt lett susing er opptaket aldeles tomt.

Har lydopptaket fanget opp noe som er skjult for menneskelige ører, eller har maskinlæringsmodellen rett og slett funnet opp hele samtalen?

− En drømmemaskin

− Det er jo egentlig en drømmemaskin, svarer seniorforsker Per Egil Kummervold.

Digi treffer ham i kantina på Nasjonalbiblioteket. Der han og kollegene har utviklet maskinlæringsmodellen NB-Whisper, som allerede i betaversjon testes ut og brukes av journalister, politiet og mange flere.

− Jeg tror selv den kan bli minst like god som det du klarer å høre selv, sier Per Egil Kummervold, seniorforsker ved Nasjonalbiblioteket Foto: Marianne Gjessing
− Jeg tror selv den kan bli minst like god som det du klarer å høre selv, sier Per Egil Kummervold, seniorforsker ved Nasjonalbiblioteket

Nasjonalbiblioteket sitter på rundt 60.000 timer med tale fra lydbøker, tekstede NRK-programmer og transkriberte taler fra Stortinget. Det er nyttig materiale for å trene tale-til-tekst-modeller.

Det er også i dette materialet svaret på en del av hallusinerings-gåten finnes. For å forstå hvordan, må vi først ta et blikk inn i selve modellen.

Fakta om NB Whisper

Modellen er basert på Open AIs modell Whisper, som er utviklet for å predikere transkribering av lydfiler.

Whisper er bygget på transformer-arkitektur, en type nevralt nettverk som består av en enkoder og en dekoder. Enkoderen gjør et spektogram, en visuell fremstilling av lyden, om til vektorform, en matematisk fremstillingen av meningen i det som ble sagt. Dekoderen, som ligner den som er i bruk i Chat GPT, bruker vektoren til å predikere transkripsjonen av lyden.

Whisper er trent på 680.000 timer med tale fra ulike språk. Vårt eget nasjonalbibliotek har trent modellen videre, blant annet for å gjøre den bedre på norske dialekter.

Den norske modellen, NB-Whisper, finnes i flere versjoner, i ulik størrelse, i beta. Hver modell er trent gjennom en kvart million steg på millioner av 30 sekunder lange lydklipp med tilhørende transkribering.

I det norske treningskorpuset ligger det 60.000 timer med tale fra lydbøker, tekstede NRK-programmer og transkriberte taler fra Stortinget.

Treningsmaterialet har såkalt svak sammenheng. Det betyr at hvert lydklipp har tilhørende tekst, men at teksten ikke er en hundre prosent korrekt ord for ord transkribering.

Les mer om Whisper i Open AIs egne artikkel om modellen.

Fra lyd til tekst

− Modellen får faktisk ikke en gang tale, men bilde av tale, sier Kummervold.

Lydklipp på 30 sekunder blir behandlet og omgjort til et spektogram, en visuell fremstilling av lyden.

En enkoder i modellen har som jobb å gjøre bildet av lyden om til vektorform, en matematisk fremstilling av meningen i det som ble sagt.

«NB Whisper fra AI-laben i Nasjonalbiblioteket», sier stemmen som har blitt til dette spektogrammet. Illustrasjon: Rudi Pedersen, Nasjonalbiblioteket
«NB Whisper fra AI-laben i Nasjonalbiblioteket», sier stemmen som har blitt til dette spektogrammet.

− Hvis man tenker seg at man koder enkeltordene agurk, tomat og fotballbane, vil agurk og fotballbane være ganske like i farge-retningen i vektoren. Men i størrelses-retningen vil agurk og tomat være nærmere hverandre. Vi prøver å gjøre om lyden til en slik meningsfull vektor, sier Kummervold.

Vektorene hjelper det nevrale nettverket å forstå ord og sammenhengen mellom ord. Noe av det første modellen lærer, er derfor å kjenne igjen hvilket språk stemmen på lydfila snakker. Når den har konkludert, ombestemmer den seg ikke midt i lydklippet.

Har du et lydopptak av en som snakker norsk ispedd engelske uttrykk, vil modellen stort sett forsøke å oversette lyden den ser, til norske ord.

Gjetter vilt

Neste ledd i modellen, dekoderen, som ligner på modellen som brukes i Chat GPT, bruker så vektorene til å genere sammenhengende tekst.

− Da vil den begynne å drømme opp tekst, ut fra det den synes passer til denne meningsvektoren, sier Kummervold og fortsetter:

− I begynnelsen av treningen prøver den bare å gjette ord, som kan, to, åtte og så videre.

Modellen får tilbakemelding fra den transkriberte teksten som hører til lydfila, og lærer at outputen var feil.

− Så begynner den plutselig å gjette riktig, helt tilfeldig finner den ett ord her og ett ord der, og etter hvert blir den bedre, sier Kummervold.

I motsetning til andre tale-til-tekst-modeller, som enten er trent gjennom overvåket trening, det vil si med nøyaktige merket ønsket output for hver input, eller uovervåket trening som lar maskinen finne mønstre i tale uten å bli fôret med tydelige merkelapper, har Whisper slått gjennom med en slags mellomting: Trening på materiale som er svak sammenheng mellom det som blir sagt og det som står skrevet.

Nettopp slikt materiale har Nasjonalbiblioteket i overflod.

Blant annet har et stort materiale fra statskanalens sendinger med tilhørende teksting blitt brukt til å trene modellen.

Nekter å skrive herr president

I bibliotekets digitale arkiv finnes også tusenvis av timer med opptak av politikere som snakker til Stortinget.

Talene er transkribert, men ikke ord for ord.

− Det frustrerte oss i starten at politikerne ofte starter flere ganger på en setning før de kommer til poenget. Det er den endelige setningen, den de kommer frem til etter å ha prøvd noen ganger, som blir transkribert, sier Kummervold.

Samtidig er det noen av frasene som ofte brukes på tinget, som aldri blir transkribert. Ingen skriver ned at trønderen sier sjø på slutten av setningen, eller totningen amma.

Eller at politikerne, hver gang de inntar talerstolen, pent sier «Herr president», forteller Kummervold.

Dermed er de tidlige versjonene av modellen, gjennom tilbakemeldingene fra transkripsjonen, trent til å ignorere ordene herr president.

Og ganske riktig. Digi har kjørt intervjuet gjort med Kummervold gjennom en tidlig versjon av NB Whisper. Modellen nekter å skrive frasen.

− Hallusiner politikernavn

− Tidlig i treningen så vi også at den liker å hallusinere politikernavn, det er veldig irriterende at Sylvi Listhaug dukker opp tilfeldig i mange samtaler, sier Kummervold.

Akkurat den feilen kommer av det motsatte problemet. Det er skrevet ned ting i referatet som ikke ble sagt. Det kan være beskjeder som «Neste taler er Sylvi Listhaug», eller «Vi tar en fem minutters pause.»

− Så kan det hende at en bil kjørte forbi akkurat idet opptaket ble gjort. Den lyden blir også kodet om til en meningsvektor, som modellen vil assosiere med teksten den få, sier Kummervold og fortsetter:

− Når den hører en lignende lyd senere, så gjør den det den har fått beskjed om å gjøre, den prøver å finne på en tekst som har samme mening.

Dersom vi alltid gir modellen en meningsfull tekst som hører til de 30 sekundene med lyd den får, vil den alltid produsere tekst, uavhengig av hva som er i lydklippet, sier Kummervold.

− Da vil den også produsere meningsfull tekst selv om det den får inn, er støy eller stillhet. Dette er en av hovedgrunnene til at vi får såkalt hallusinering. For å unngå dette, må vi også trene modellen til å forstå at av og til skal den ikke skrive tekst, forklarer han videre.

Skulle det derimot ved en feiltakelse være noe som ble sagt i det lydklippet som vi kodet som stillhet, vil risikoen være større for at den velger å gå for stillhet, selv om det er tale på båndet.

Dermed finner den opp setninger som Jeg elsker deg til journalistens tomme lydopptak.

Men hvorfor sier den det så mange ganger?

For at dekoderen skal gi så riktig utfall som mulig, trenger den sammenheng. Når den transkriberer et 30 sekunders lydklipp, får den derfor beskjed om å skjele til de 30 sekundene som kom rett før.

Det gir bedre treff, fordi det gir noen hint til hvilke vektor-sammenhenger som skal prioriteres. Men det gir også en risiko for gjentakelser.

− Kan bli like god som deg

Så hvordan hindrer man maskinen i å hallusinere?

− Det absolutt viktigste verktøyet vi har, er treningsdataene, svarer Kummervold.

Da modellen hadde en tendens til å hallusinere politikernavn, ble løsningen å slette data der det var ulikt antall navn i lydfila og tekstfila.

− Vi sletter ekstremt mye tekster, sier han.

Nå er modellen på vei ut av beta. Kummervold og kollegene lanserer den første offisielle versjonen 15. februar.

Arbeidet stopper ikke der. Målet er profesjonell transkribering.

− Jeg tror selv den kan bli minst like god som det du klarer å høre selv, sier Kummervold.

Powered by Labrador CMS