kunstig intelligens
Amazons nye KI-modell legger til rette for menneskelignende stemmesamtaler
Selskapet kunngjorde sin nye KI-modell «Nova Sonic».
Det legges mye vekt på språkmodeller og bilde/-video-generatorer når det gjelder KI-teknologi, men det gjøres også store fremskritt innen KI-generert tale. Nå har Amazon kunngjort store nyheter på den fronten.
På nettsidene sine har Amazon avduket en ny KI-modell døpt «Nova Sonic», som skal legge til rette for enda mer livaktige og naturlige samtaler med KI-modeller enn det vi har sett hittil.
Uttrykksfulle stemmer
Nova Sonic inngår i den nye serien av såkalte grunnmodeller under Nova-navnet som Amazon kunngjorde i desember. Grunnmodeller («foundation models») er en betegnelse på allsidige, generative KI-modeller som er trent på store datamengder og som kan tilpasses mange ulike bruksområder.
Den nye Nova Sonic-grunnmodellen kombinerer talegjenkjenning og talegenerering i én og samme modell, og Amazon sier målet er å muliggjøre «menneskelignende» samtaler i sanntid i KI-applikasjoner.
Ifølge selskapet forstår den nye modellen ulike talemåter og kan generere uttrykksfulle stemmer – både maskuline og feminine. Modellen kommer med en ny arkitektur som skal være i stand til å tilpasse tonefall, rytme og stil etter innholdet og konteksten i samtalen.
Ved å kombinere talegenerering og talegjenkjenning i den samme modellen, skal det ifølge Amazon bli mye enklere å lage samtalebasert applikasjoner, sammenlignet med måten andre tilsvarende modeller lages på.
– Tradisjonelle tilnærminger for å bygge stemmeaktiverte applikasjoner krever komplisert samspill mellom flere modeller, for eksempel talegjenkjenning for å konvertere tale til tekst, språkmodeller for å forstå og generere svar, og tekst-til-tale for å gjøre teksten om til lyd, skriver Amazon.
Grundig testet
Nova Sonic kan brukes til å aktivere stemmen i en rekke ulike applikasjoner. Amazon sier den har blitt grundig testet for et bredt spekter av applikasjoner, inkludert automatisering av kundeserviceanrop på kontaktsentre, utgående markedsføring, stemmeaktiverte personlige assistenter og agenter, samt interaktiv utdanning og språklæring.
I utgangspunktet støtter Nova Sonic kun engelsk, men selskapet sier at støtte for flere språk er på vei. Akkurat når den eventuelt får støtte for norsk, er ennå uvisst.
Modellen retter seg primært mot utviklere og er tilgjengelig via Amazon Bedrock, en tjeneste som gir kunder tilgang til en rekke grunnmodeller fra flere aktører som kan brukes til å bygge generative KI-applikasjoner.
Sikkerheten skal også være ivaretatt, i form av blant annet innebygde mekanismer for innholdsmoderering og vannmerking.
I likhet med de fleste andre former for KI-teknologi er også KI-generert tale en potensielt stor sikkerhets- og personverntrussel – først og fremst i form av «deepfake»-fenomenet.
KI-stemmegenerering er i mange tilfeller så realistisk at selv familiemedlemmer til personen som har fått stemmen sin stjålet på denne måten, lar seg lure, som Digi tidligere har fortalt.