kunstig intelligens

Norsk ekspert frykter ikke nyutviklet AI som skriver troverdige falske nyheter

Forskere fra OpenAI har utviklet et selvlærende program som blant annet kan utvide setninger til fullstendige og meningsfulle tekster og dermed er i stand til å lage egne historier. Førsteamanuensis Morten Goodwin er ikke bekymret, men mener det er betenkelig at selskapet ikke vil frigi algoritmene.

Førsteamanuensis Morten Goodwin ved Senter for kunstig intelligens ved Universitetet i Agder.
Førsteamanuensis Morten Goodwin ved Senter for kunstig intelligens ved Universitetet i Agder.

OpenAI er en non-profitorganisasjon som består av et team på omtrent hundre forskere som sitter i San Francisco, og som har som mål å sikre at kunstig intelligens kommer hele menneskeheten til gode. Det nye, selvlærende programmet, GPT-2 har blitt trent opp ikke bare til å utvide setninger til hele historier, men kan også stille spørsmål ut i fra en tekst, oppsummere lange tekster og utføre maskinoversettelse - alt uten spesifikk oppgavetrening.

Et eksempel

I den oppsiktsvekkende artikkelen som forskerne la ut på sin blogg i februar, og som digi.no skrev om, demonstreres noe av det programmet kan gjøre. Forskerne foret programmet med følgende to innledende setninger:

“I et sjokkerende funn oppdaget forskere en flokk med enhjørninger som bor i en fjerntliggende, tidligere ikke utforsket dal, i Andesfjellene. Enda mer overraskende for forskerne var det faktum at enhjørningene snakket perfekt engelsk.”

Ut i fra disse innledende setningene laget programmet fortsettelsen med følgende historie:

Vitenskapsmannen navnga populasjonen etter deres særegne horn, Ovids enhjørning. Disse firhornede, sølvhvite enhjørningene har tidligere vært ukjente for vitenskapen. Nå, etter nesten to århundrer, er mysteriet om det som utløste dette merkelige fenomenet endelig løst.

Dr. Jorge Pérez, en evolusjonsbiolog fra Universitetet i La Paz, og flere følgesvenner, undersøkte Andesfjellene da de fant en liten dal, uten andre dyr eller mennesker. Pérez la merke til at dalen hadde det som syntes å være en naturlig fontene, omgitt av to topper med stein og sølvlignende snø. Pérez og de andre dristet seg videre inn i dalen. "Da vi nådde toppen av en høyde, så vannet blått ut, med noen krystaller på toppen," sa Pérez.

Pérez og hans venner var forbauset over å se flokken med enhjørninger. Disse skapningene kunne sees fra luften uten å måtte bevege seg altfor mye for å se dem – de var så nær dem at de kunne ta på hornene deres.

Mens de undersøkte disse bisarre skapningene, oppdaget forskerne at skapningene også snakket ganske vanlig engelsk. Pérez uttalte da: "Vi kan se, for eksempel, at de har et felles språk, noe slikt som en dialekt eller noe dialektlignende."

Dr. Pérez mener at enhjørningene kan ha sin opprinnelse i Argentina, der dyrene antas å være etterkommere av en tapt rase med mennesker som levde der før det kom mennesker til disse delene av Sør-Amerika.

Selv om deres opprinnelse fortsatt er litt uklar, tror noen at skapningene kanskje ble skapt da et menneske og en enhjørning møtte hverandre i en tid før menneskelig sivilisasjon. Ifølge Pérez ser slike hendelser ut til å være ganske vanlige i Sør-Amerika.

Pérez påpekte likevel at den eneste måten å vite sikkert om enhjørningene faktisk er etterkommere etter en tapt, fremmede rase, sannsynligvis er gjennom DNA. "Men de synes å kunne kommunisere ganske bra på engelsk, noe jeg tror er et tegn på evolusjon, eller i det minste en endring i sosial organisasjon," sa forskeren.

Innhold fra Internett

Teksten er i sin helhet produsert av algoritmen. Selv navnet på forskeren og universitetet han kom fra er noe programmet har funnet på.

Forskerne presiserer at eksempelet er håndplukket blant en lang rekke tester og eksperimenter med programmet. Selv om eksempelet er håndplukket, betyr det ikke at det ikke er representativt, men viser hva programmet kan få til. GPT-2 har blitt trent opp til å forutsi det neste ordet i en Internett-tekst på 40 GB. Algoritmen er basert på fordelingssemantikk, som bygger på det faktum at ord som forekommer i en lignende kontekst også kan ha en lignende betydning. Programmet er en stor språkmodell med 1,5 milliarder parametere, opplært på et datasett på åtte millioner nettsider.

– Vi opprettet et nytt datasett som vektlegger mangfold av innhold, ved å hente innhold fra Internett. For å ivareta dokumentkvaliteten brukte vi kun sider som har blitt behandlet eller filtrert av mennesker, skriver forskerne.

For å ivareta dokumentkvaliteten, brukte de innhold som andre brukere hadde merket som interessant, pedagogisk eller morsomt. Dette førte til høyere datakvalitet enn ved lignende datasett, ifølge forskerne. Programmet er kameleonlignende og tilpasser seg stilen og innholdet som utgjør bakgrunnen for teksten. Dette gjør det mulig for programmet å generere realistiske og sammenhengende fortsettelser om et emne etter deres valg.

Logiske svakheter

Selv om teksten over kan leses som en sammenhengende historie uten veldig tydelige logiske brister, så viser den likevel noen svakheter, for eksempel er uttrykket «firehornet enhjørning» en selvmotsigelse. Forskerne forteller at de i tester har sett at programmet også kan repetere tekst, gjøre logiske og urealistiske feil, som å fortelle om branner under vann og gjøre unaturlige temavekslinger. Dette er noe forskerne kommer til å jobbe videre med.

Hvor lang tid det tar å generere en brukbar tekst avhenger ifølge forskerne av hvor kjent modellen er med konteksten.

– Når du blir bedt om emner som er godt representert i dataene, som Brexit, Miley Cyrus, Ringenes Herre og så videre, så synes programmet å klare å generere gode eksempler på omtrent halvparten av tiden, forteller forskerne.

Det motsatte er likevel også sant. På svært tekniske eller esoteriske typer innhold kan modellen prestere dårlig..

Programmet som OpenAi har laget kan mer enn å utvide enkle tekster til omfattende historier. Det klarer også å svare på spørsmål fra en gitt tekst, oppsummere tekst og lage brukbare maskinoversettelser. På disse oppgavene hadde programmet likevel en lavere poengoppnåelse enn på den førstnevnte oppgaven.

Kan misbrukes

Forskerne peker på flere nyttige bruksområder for slike programmer samtidig som de også peker på hvordan programmene kan misbrukes. Programmet kan brukes til gode formål som

  • skriveassistenter med kunstig intelligens
  • som avanserte samtalepartnere i chatbots
  • til maskinoversettelse mellom språk
  • bedre talegjenkjenningssystemer

Samtidig kan de misbrukes til å

  • genere falske nyhetsartikler
  • forsinke andre på nettet
  • automatisere produksjonen av krenkende innhold i kommentarfelt og på sosiale medier
  • automatisere produksjonen av spam eller phishing

Nettopp av disse grunnene holder forskerne foreløpig selve de ferdige programmene tilbake og vil ikke publisere dem for allmenheten. I stedet vil de legge seg på en trinnvis utgivelsesstrategi. Det innebærer at de vil utgi en familie av programmodeller over tid. Foreløpig har de publisert en liten testversjon som er tilgjengelig på Github. Flere publiseringer skal komme etter hvert.

– Formålet med vår trinnvise publisering av GPT-2 er å gi folk tid til å vurdere egenskapene til disse modellene, diskutere deres samfunnsmessige implikasjoner og vurdere effekten av utgivelsen etter hvert trinn, skriver forskerne i artikkelen.

Kritisk til ikke-publisering

Førsteamanuensis Morten Goodwin ved Senter for kunstig intelligens ved Universitetet i Agder er godt kjent med den nye algoritmen til OpenAi og er ikke overrasket over hva utviklerne har fått til.

– Det er ikke overraskende at såkalte kunstig intelligens-algoritmer blir bedre til å skrive tekst. Vi har sett mange forbedringer av slike algoritmer, sier han.

– Forskjellen er at OpenAIs siste algoritme har blitt så flink til å skrive at det er vanskelig å skille mellom en tekst skrevet av kunstig intelligens og en skrevet av ekte mennesker.

KI-eksperten fra Agder mener det er betenkelig at OpenAI ikke har publisert hele den opptrente algoritmen.

– For det første kan en åpen algoritme brukes av alle som ønsker det, noe som er et av grunnprinsippene til OpenAI. For det andre kan en åpen algoritme testes og forbedres av andre forskere. Det er mye lettere å tro på fantastiske resultater etter at andre har testet og verifisert at alt fungerer. Slik fungerer forskningen, påpeker han.

Nyttig skrivehjelp

Goodwin er enig i at algoritmen kan brukes til å lage falske nyheter, men han ser også at den kan bli et nyttig arbeidsredskap for journalister og skribenter.

– Jeg ser absolutt for meg at denne algoritmen, eller senere avarter kan brukes til å skrive nyhetssaker. Det betyr ikke at den kan erstatte journalister. En journalist vil kanskje skrive noen stikkord og så vil algoritmen gjøre resten, tror han.

Goodwin ser flere andre nyttige funksjoner med OpenAis algoritme.

– I tillegg til at journalister kan få hjelp til å skrive, kan en journalist bruker algoritmen til å oversette tekst for å treffe publikum, sier han.

Ved å legge inn de riktige stikkordene tror han algoritmen kan brukes til å skrive både artikler som passer for høyt utdannede forskere, artikler med fokus på ungdom, og artikler med fokus for økonomer.

– Lange tekster kan summeres opp automatisk og artiklene kan justere seg automatisk for hele tiden å treffe publikum, sier han.

Vanskeligere kan det bli å få algoritmen til å skrive hele bøker.

– Jo lenger teksten er, jo vanskeligere blir det for algoritmene å skrive. Det betyr at det er mye enklere å skrive korte setninger, eller to-tre siders artikler, enn å skrive en hel bok, påpeker han.

– Årsaken til dette er at algoritmene må huske alt som er skrevet tidligere for at det skal være sammenheng i teksten. I dag klarer algoritmene å huske litt, men ikke lenge nok til å skrive en hel bok, selv ikke OpenAIs algoritme, legger han til.

Powered by Labrador CMS