kunstig intelligens

Mozilla: – Monopol på stemmedata minner om patent på mus og tastatur

Mozilla har samlet inn stemmedata fra nesten 200.000 i et forsøk på å bryte gigantenes datamonopol.

Mozilla Common Voice. Illustrasjon.
Mozilla Common Voice. Illustrasjon.

Algoritmer til talegjenkjenning og talesyntese spås å ha et enormt potensial som fremtidens datagrensesnitt, men de krever også store datamengder for å trenes opp. Og de treningsdataene finnes i dag nærmest utelukkende i databaser hos de største it-bedriftene.

George Roter er Director ved Mozillas Open Innovation Programs. En del av ansvaret hans er å styre Mozillas arbeide med å demokratisere stemmeteknologier gjennom åpne data. Roter har tidligere stiftet og ledet Engineers Without Borders Canada. Foto: Mozilla
George Roter er Director ved Mozillas Open Innovation Programs. En del av ansvaret hans er å styre Mozillas arbeide med å demokratisere stemmeteknologier gjennom åpne data. Roter har tidligere stiftet og ledet Engineers Without Borders Canada.

Hvis teknologien skal være åpen for alle, er det behov for en demokratisering av stemmedata, mener George Roter, som er Director for Open Innovation Programs hos Mozilla.

– Det er bare de som allerede har en enhet i hjemmet ditt eller i lomma di som har adgang til de volumene av stemmedata som må til for å trene disse teknologiene, understreket Roter på konferansen Techfestival, som nylig ble arrangert i København.

Mozilla står bak prosjektet Common Voice, som er et forsøk på å crowdsource en database med stemmedata. Prosjektet har som mål å åpne arbeidet med stemmedata for flere, og foreløpig er det en suksess, forsikrer George Roter.

– Vi har samlet inn over 3000 timer, og 190.000 har bidratt med sin stemme på tvers av 70 språk. Vi gjør datasettet tilgjengelig for forskere, gründere og bedrifter – alle som har lyst til å trene taleteknologier.

Common Voice-prosjektet er todelt. Dels kan alle i verden «donere stemmen sin» til databasen ved å lese inn en setning til en mikrofon. Og dels kan man høre andres opptak, og på den måten validere om det som skulle sies, rent faktisk er hva personen sier.

Resultatet burde dermed gjerne bli en kvalitetssikret database med stemmedata og korresponderende tekst – perfekt til trening av algoritmer. Databasen ledsages dessuten av Mozillas deep learning-arkitektur til tale-til-tekst, som har åpen kildekode.

Mellom deg og internett

Mozilla har utviklet Common Voice så den skal være enkelt å bruke. Her er brukeren i ferd med å validere et opptak med et klikk på en tommelfinger som peker opp eller ned. Skjermbilde: Common Voice
Mozilla har utviklet Common Voice så den skal være enkelt å bruke. Her er brukeren i ferd med å validere et opptak med et klikk på en tommelfinger som peker opp eller ned. Skjermbilde: Common Voice

Det er ikke tilfeldig at Mozilla ser nettopp stemmeteknologi som et område som trenger å bli demokratisert.

– Bruken av stemmestyring har eksplodert. Og hvis man ser litt framover på den utviklingen, kommer vi anse dette som et sentralt brukergrensesnitt, mener George Roter.

At data – og en forlengelse av den teknologien – blir styrt av en håndfull bedrifter, har problematiske implikasjoner, poengterer han.

– Tenk deg hvis teknologier som mus og tastatur på 80-tallet hadde vært proprietære teknologier, og et selskap som IBM hadde samlet data på alle musebevegelsene. Det hadde vært litt skremmende. Og jeg mener ikke at dette er dramatisk annerledes enn hva vi ser med stemmestyring i dag, sier George Roter:

– Disse bedriftene benytter en tilnærming som gjør dem til forbindelsen mellom deg og hele internett.

Roter nevner som eksempel at han har mottatt en flom av reklamer for safariturer etter at datteren hans begynte å spørre husets Google Assistant om sjiraffer.

Et annet problem er inklusjon.

– Hvis det meste av denne teknologien blir utviklet og implementert av disse store bedriftene, har de vanligvis interesse av å gjøre den tilgjengelig for områder som kan skape profitt.

Dette gjør det for eksempel usannsynlig at Google, Apple eller Amazon vil lansere assistentene sine til mindre afrikanske språkområder i løpet av den nærmeste fremtiden.

– Vi vet også at disse teknologiene ofte har vansker med å forstå folk som ikke snakker morsmålet sitt. Hvis du har en dansk aksent når du snakker engelsk, klarer de seg dårligere. De har også tradisjonelt hatt en negativ vridning (bias) mot kvinner, fordi de har blitt trent mer på mannsstemmer enn kvinnestemmer, sier George Roter.

Og til slutt er det spørsmålene om personvern og sikkerhet, som nylig ble understreket da både Google og Apple innrømmet at løst tilknyttede ansatte lytter gjennom stemmeopptak for å transskribere dem.

– Dette skjer ikke med onde hensikter. De gjør det for å gjøre teknologien bedre. Men det er en intim ting, en samtale, og det skaper bekymring, påpeker George Roter.

Fra Wales til Rwanda

George Roter understreker at han er optimistisk til stemmeteknologi generelt.

– Jeg mener at dette er en sentral og helt utrolig sterk teknologi. Men det er et spørsmål om hvordan den blir utviklet.

Derfor håper han at miljøet rundt Common Voice-prosjektet fortsetter å vokse – og spesielt i små språkområder som for eksempel Danmark.

– Dette er et veldig bredt samarbeid. Det er individer, men også bedrifter og organisasjoner. Det er et språkinstitutt i Wales som har deltatt og bygd opp en stor database på walisisk, fordi de gjerne vil se at språket blomstrer, forteller George Roter.

Et annet partnerskap har Mozilla fått til med en organisasjon i Rwanda, som gjerne vil ha en rwandisk stemmeassistent som snakker Kinyarwanda – et bantuspråk som snakkes av omkring 7 millioner mennesker.

– Dette er folk som veldig gjerne vil se at denne teknologien fungerer på deres språk. Folk som tror på stemmeteknologier, og som gjerne ser at de blir mer tilgjengelige.

Saken ble først publisert på danske Datatech, og gjøres tilgjengelig på norsk for abonnenter av Digi Ekstra gjennom vår samarbeidsavtale med Teknologiens mediehus/Ingeniøren.

Powered by Labrador CMS