kunstig intelligens

Danske forskere bruker dyp læring for å finne stemmer i en høystakk av støy

Dyp læring (deep learning) har vært avgjørende for arbeidet med avansert lydanalyse, forteller en dansk forsker.

Morten Kolbæk, Ph.d., Universitetet i Aalborg i Danmark.
Morten Kolbæk, Ph.d., Universitetet i Aalborg i Danmark. Illustrasjon: Aalborg University / skjermbilde fra Youtube-video (montasje:digi.no). Portrettfoto: CC BY-ND 2.5 DK

Den menneskelige evnen til å lytte til én enkelt stemme når du har en samtale i et rom fullt av konkurrerende samtaler, er enormt vanskelig å etterligne med en algoritme.

I arbeidet med avansert lydanalyse er det såkalte cocktailparty-problemet fremdeles uløst. Men nå har danske forskere tatt et skritt nærmere en løsning med dyp læring.

Om forskningen

'Single-Microphone Speech Enhancement and Separation Using Deep Learning' er tittelen på Morten Kolbæks Ph.d.

Projektet er støttet av Oticon Fonden og veiledet av professor Jesper Jensen og professor Zheng-Hua Tan, som begge er tilknyttet Center for Akustisk Signalbehandling ved Aalborg Universitets Institut for Elektroniske Systemer.

– Utfordringen er hvordan man fjerner uønskede støykilder når du gjør opptak i et støyfullt rom med én enkelt mikrofon, forklarer Morten Kolbæk, som nettopp har skrevet en ph.d. om emnet ved Aalborg Universitet.

Når man kjenner et lydbilde på forhånd, som i et klinisk test-oppsett, kan algoritmer identifisere én enkelt stemme like godt som et menneske. Men hvis teknikken skal benyttes i for eksempel høreapparater, er ikke dette nok. Modellen må kunne identifisere en ukjent stemme blant en ukjent mengde av stemmer i en situasjon med en ukjent mengde bakgrunnsstøy.

– Uten forutgående kunnskap er den menneskelige hjernen fremdeles den beste maskinen, sier Morten Kolbæk.

Label permutation

Utfordringen ved å få en algoritme til å separere lyden fra to talere – som ikke er kjent på forhånd – er det som litteraturen kaller «label permutation»-problemet.

Grunnleggende går problemet ut på at man gjerne vil ha en output fra modellen med én kanal for hver taler. Men du vet ikke på forhånd hvilken stemme som kommer ut fra hvilken kanal.

Det er en utfordring når man trener modellen, forklarer Morten Kolbæk. For når du driver med supervised learning, må du sammenligne modellens output med det riktige resultatet – her i form av lyden fra de to separate talere.

Med andre ord: Hvis taler A blir separert ut av modellen som output B, men treningsmodellen forventet at taleren kom i output A, vil det fremstå som et feil resultat.

– Man kan ikke trene modellen på denne måten, fordi du ikke kan guide det nevrale nettverket, sier Morten Kolbæk.

De danske forskere løste problemet ved å endre litt på treningsalgoritmen, og essensielt gjøre rekkefølgen av talere likegyldig under treningen.

– Ved å gjøre det, løser vi label permutation-problemet. Det innebærer at man relativt enkelt kan trene et nevralt nettverk til å separere stemmer fra hverandre. Dette er noe man ikke kunne gjøre tidligere, sier forskeren.

Algoritmen blir demonstrert i denne videoen:

Rå data

Algoritmen fra Morten Kolbæk er trent på et talekorpus med navnet Wall Street Journal, og som ble skapt til forskning i talegjenkjenning. Men korpuset består bare av enkeltpersoner, forklarer Morten Kolbæk.

– For å simulere cocktailparty-problemet tok vi forskjellige stemmer og kombinerte dem. Det innebærer også at vi i prinsippet har uendelige mengder data, forteller han.

Ut over dette er ikke dataene behandlet i noe større omfang.

– Noe av det fantastiske ved nevrale nettverk er at man kan bruke rådata. Vi transformerer formatet som lyden presenteres i. Men det er den eneste transformasjonen av dataene som vi foretar, sier Morten Kolbæk.

– Tidligere snakket man mye om egenskapsgenerering (feature engineering), hvor man skulle behandle data med forskjellige metoder. Det gjør vi ikke lengre, og vi får en veldig god ytelse ved å benytte det mer eller mindre rene signalet.

Dyp læring er avgjørende

Historisk sett har oppgavene med å isolere en stemme fra bakgrunnsstøy og isolere stemmer fra hverandre vært to forskjellige disipliner, fordi de hver for seg har vært veldig kompliserte.

Dermed begynte Morten Kolbæk arbeidet sitt med dyp læring.

– Vi begynte med rene talesignaler hvor det ikke var noen bakgrunnsstøy, sier han. – Men vi fant ut at vi kunne trene modellen til også å fjerne bakgrunnsstøy, hvis vi bare inkluderte bakgrunnsstøy i inputen under trening.

Bruk av dyp læring har vært avgjørende, forteller Morten Kolbæk.

– Historisk sett har man forsøkt å utvikle svært kompliserte statistiske modeller. Disse metodene – som ikke er nye, men som vi nå har ressurser til å trene – er ganske enkle. Likevel fungerer de ekstremt godt. Det har vært overraskende hvor effektive disse metodene er.

Forskningen kan være avgjørende for å kunne forbedre høreapparaters evne til å skjelne én stemme fra en annen. Men her er den umiddelbare utfordringen at teknologien må kunne fungere på en liten datamaskin bak øret. Og i tillegg er algoritmen fremdeles for stor.

Men det problemet vil nok ikke å eksistere for evig, mener Morten Kolbæk.

– Det har gang på gang vist seg å være bare et spørsmål om tid før utviklingen på maskinvaresiden har hentet seg inn igjen.

Artikkelen har tidligere vært publisert på Datatech. Datatech tilhører Teknologiens Mediehus.

Powered by Labrador CMS