telekom

KI-drevet app gir stemme til folk med talevansker

Nederlandske Whispp har utviklet en app som omdanner knapt hørbar tale til en tydelig og personlig stemme.

Teknisk direktør og medgründer Akash Raj i Whispp på stand i Barcelona, en måned etter at produktet som gir stemme til de nesten stemmeløse er klart for markedet.
Teknisk direktør og medgründer Akash Raj i Whispp på stand i Barcelona, en måned etter at produktet som gir stemme til de nesten stemmeløse er klart for markedet.

Mobile World Congress i Barcelona: Den nederlandske oppstartbedriften har utviklet Whispp-appen i løpet av de tre siste årene. Den siste måneden har de tatt steget ut fra utvikling til å tilby appen til markedet. Vi møter medgründer og teknisk direktør i selskapet, Akash Raj, under en sidekonferanse i Barcelona, dagen før Mobile World Congress starter. De har også utstilling på selve messen.

– Det hele startet med gründeren Joris Castermans. Han har stammet ganske kraftig hele livet. Det som viser seg, er at mange som plages av stamming, ikke gjør det når de hvisker. Det satte i gang utviklingen av en app som kunne gjøre om hvisking til tale, forklarer Raj.

På nettstedet deres sier Castermans at som barn og særlig som ungdom var han veldig plaget av stammingen. Han ble sky, følte seg sosialt isolert og hadde vansker med å få venner.

Andre «hvisker også»

Etter at arbeidet deres ble kjent ble de kontaktet av folk med andre typer talevansker, eksempelvis folk med skader som hemmet talen, eksempelvis etter kreftoperasjoner. De fortalte at deres stemmer likner på hvisking og lurte på om teknologien kunne hjelpe dem også. Det kunne den, fant de raskt ut, forklarer Raj.

– Whispp er et rent programvareselskap. Det er ikke noe spesiallaget hardware inne i bildet. Det er mobiltelefonene som benyttes til å gjennomføre samtaler. Den som har talevansker ringer eller starter videosamtale via Whispp-appen, mens den andre delen av samtalen ikke trenger å bruke appen, sier han.

Noe av det som er spesielt med appen, er at den trenes opp med den opprinnelige stemmen til brukeren, slik at det virkelig skal høres naturlig ut. Den kunstige intelligensen i bunnen er trent opp på så mange ulike talehemmede stemmer at denne delen ikke trenger å trenes opp.

Trenger svært kort forsinkelse

– Den største utfordringen har vært å gjøre dette i sanntid. Det har vi klart. Vi har jobbet oss ned til en forsinkelse på 200 millisekunder, noe som er såpass hurtig at deltakerne i samtalen ikke opplever forsinkelsen, at det blir en naturlig samtale, sier Raj.

Det finnes mange typer oversettere, men utfordringen er at disse gjerne går via tekst til tale og tale til tekst, noe som fører til at man mister mye av det som gjør en naturlig samtale til akkurat det.

– Det vi gjør er å oversette direkte fra tale til tale, noe som betyr at mye av det som gjør en stemme personlig, kommer med, sier han.

Trener med gamle opptak

Stemmen som kommer ut til mottakerne er gjerne trent med den enkeltes egen tale, eksempelvis fra gamle opptak. For de som aldri har hatt noe stemme, fungerer selvsagt ikke dette.

– Vi startet egentlig arbeidet med dette for fem år siden, da kunstig intelligens ikke var like tilgjengelig som i dag. Mye av arbeidet var å utvikle egne modeller for KI, sier Raj.

De siste årene har selskapet hatt investorer, og nå er det meningen å selge produktet. Raj er åpen på at de er usikre på hvordan salget skal foregå. Men at det vil være forskjellige modeller fordi ulike land har veldig ulike måter å finansiere hjelpemidler på, er tydelig. Enkelte steder vil tjenesten bli solgt rett til sluttbrukere, i andre markeder er det myndigheter, kommuner eller hjelpemiddelsentraler som kan være kunden. I USA og enkelte andre land uten offentlig helsesystem vil det sannsynligvis være forsikringsselskaper som er de mest aktuelle kundene.

– Dette er et produkt som kan gjøre livet svært mye bedre for folk med talehemminger, som gir dem bedre mulighet til å kommunisere med sine kjære, sier Raj

Powered by Labrador CMS