kunstig intelligens
Slik skapte vi vår egen KI-stemme
På veien støtte vi på uventede blundere, språkforvirring og elleville forkortelser.
Denne høsten har vi laget en KI-stemme som automatisk leser opp artiklene på TU.no og Digi.no.
Ved hjelp av teknologi fra Elevenlabs kunne vi lage en klonet variant av en ekte stemme, ved hjelp av tre timers opptak med prating og tekstopplesning. Etter en uformell audition på kontoret var det til slutt Heidi Sævold som ble valgt ut som stemmen vår.
Men det skulle vise seg å være flere humper i veien. I denne artikkelen skal vi fortelle om noe av det som gikk galt underveis.
Alle lydfiler i saken er automatisk genererte opplesninger av innskrevet tekst, basert på ulike stemmeopptak matet inn i programvaren Elevenlabs.
Dansk
Den nyeste og anbefalte modellen i programvaren var ennå ikke utviklet for norsk. Da vi, intetanende om dette, matet den første teksten inn i testverktøyet, gjettet den seg frem til det nærmeste tilgjengelige språket for å lese opp den norske teksten vi matet inn.
Ikke lystig nok
Vi fortsatte dermed med en eldre stemmemodell. Denne framstod umiddelbart mer kunstig og robot-aktig, men også noe aggressiv og amper enn den nyere modellen.
Ville det kompensere for amperheten hvis testopptaket genereringen baserer seg på var ekstra mykt, og ekstra lystig? Det måtte prøves:
For å få frem en særlig myk tone i testgrunnlaget på en naturlig måte, leste Heidi inn en tekst om forfatterskapet til Anne Kat-Vestly. Det skulle jo kunne bli ganske lystig? Men tekst-til-stemme-resultatet var et godt stykke fra det vi ønsket:
I en begynnende desperasjon testet vi innlesning av vitser for barn, og KI-genererte opplesning av den samme teksten med flere utropstegn, også uten ønsket effekt:
Tall og forkortelser
I den første utgaven av en komplett stemme, med bearbeiding fra programvareleverandøren og et bredere grunnlag, viste det seg at resultatet lignet mer på datagrunnlaget enn ved bruk av testverktøyet. Den eventyraktige forteller-stilen ble for treg og daff, og tekstene måtte spilles inn på nytt, før vi endelig kom frem til en stemme med flyt og en tone som vi mener passer til TU og Digi.no.
Men det var fortsatt humper i veien. Da vi testet videre med våre egne artikler av den mer tekniske sorten, viste KI-en seg å ha store problemer med tall og forkortelser. Det var overraskende hvor mange måter den kunne uttale 2023 eller TWh (terrawattimer) på. Sistnevnte ble tilsynelatende tolket som et asiatisk språk.
«Statnett har fått henvendelser tilsvarende 61 TWh årlig. Alle henvendelsene utgjør samlet rett i underkant av 7.000 MW (...) Det tilsvarer 61,2 TWh årlig (...) Det vil innebære et strømforbruk på 15 TWh årlig. Økt strømforbruk knyttet til datasentre vil utgjøre 1,2 TWh i år 2020 og 3,5 TWh i år 2035.»
Både årsstall og større tall som pengesummer tydeliggjorde stemmens svakheter med både gjetning og stamming.
«1887. 1840. 1991. 1992. 1993. 2001. 2011. 2021. 2024. 1887. 1840. 500 000. 2 millioner. 12 000 000 000. 58,5.»
Her må vi trekke inn den polske utvikleren vår Tomasz Nolberczak, som har jobbet med å få opp den tekniske løsningen på nettsidene våre.
– Dette er bare KI, den vet ikke alt om hva vi ønsker å oppnå. Selv når du bruker Chat GPT til daglig, kan den plutselig endre språk eller prøve andre nye ting. Slike problemer er veldig vanskelige å finne, fordi disse ordene ikke finnes i alle artikler, sier Tomasz Nolberczak.
Med et begrenset ordforråd på norsk utviklet han en tilpasset ordbok for å bygge bro mellom det skrevne og det talte språket, hovedsakelig med forkortelser. Med ordboken vil ord som GW bli lest som Gigawatt, og TU vil bli lest som T U og ikke «tu».
Publisering
I slutten av oktober begynte vi å teste systemet på artiklene våre. Da oppdaget vi noe nytt:
Overskriftene ble tolket som roping! Rett og slett fordi den hadde større skrift. Opplesningene ble derfor åpnet med lettere desperate rop om leserens hjelp eller oppmerksomhet.
Dette var en av de siste feilene som ble rettet, før vi endelig kunne lansere løsningen for publikum.
Nye oppgaver på vei
Heidi Sævold har nå lest opp artiklene våre i flere uker. Stemmen er lagt inn på alle nye artikler, med unntak av meningsartikler, NTB-artikler og kommersielle artikler.
– Etter lanseringen har også kolleger som har hørt stemmen lese opp en bestemt artikkel og kanskje uttalt noe på en rar måte, fortalt om dette som om det faktisk var jeg som sa det. Det er vel en påminnelse om at det som er kunstig langt på vei vil kunne oppfattes som ekte, selv om det er generert med full åpenhet, sier Heidi Sævold.
Utviklingen går fort videre, også med syntetiske stemmer. Derfor kan det godt hende at den neste stemmen vår ikke blir klonet, men skapt helt fra bunnen av. Først må teknologien bli bedre tilpasset det norske språket.
I mellomtiden planlegger vi å gi nye oppgaver til Heidis stemme. Kanskje blir den brukt i sosiale medier, på spillelister eller til korte nyhetsoppdateringer.
Men først må vi teste mer.