kunstig intelligens

Datamaskiner tenker kanskje bedre uten vår hjelp

Ta mennesket ut av modellen: Ny forskning indikerer at den viktigste suksessparameteren for kunstig intelligens ikke er selve datamodellen, men harde treningsdata og rå datakraft.

Den grønne kurven viser Moores lov om veksten i antallet transistorer i databrikker. Den er grunnlaget for en påstand om at generelle, skalerbare metoder er mer effektive enn å bruke menneskelig tankevirksomhet på å forfine modellene bak kunstig intelligens. Påstanden får støtte i den måten som programmet AlphaGo Zero har lært seg selv å spille Go på. Samt i suksessen for proteinbrettings-programmet AlphaFold 2.
Den grønne kurven viser Moores lov om veksten i antallet transistorer i databrikker. Den er grunnlaget for en påstand om at generelle, skalerbare metoder er mer effektive enn å bruke menneskelig tankevirksomhet på å forfine modellene bak kunstig intelligens. Påstanden får støtte i den måten som programmet AlphaGo Zero har lært seg selv å spille Go på. Samt i suksessen for proteinbrettings-programmet AlphaFold 2.

GPT-3 kan skrive tekster, AlphaGo Zero kan spille Go, og AlphaFold 2 kan brette proteiner. Dette er tre eksempler fra den siste forskningen på kunstig intelligens (AI) på enkle, minimalt forutinntatte modeller, trent på enorme mengder data og med enorme mengder datakraft.

Den markante suksessen for blant andre disse modellene har rettet oppmerksomheten mot et essay som en av pionerene innen såkalt forsterkende læring (reinforcement learning) tilbake i 2019 publiserte på bloggen sin «Incomplete Ideas»:

Essayet het «The Bitter Lesson», og i det presenterte Richard Sutton – AI-forsker og mannen bak den ledende boka innen reinforcement learning – det han kalte «den største læresetningen fra 70 års AI-forskning», nemlig at «generelle, skalerbare metoder til syvende og sist er de mest effektive, og det med stor margin» i forhold til spesialiserte modeller med en høy grad av menneskelig input.

En stor del av forklaringen er ifølge Richard Sutton Moores lov, som vi vet sier at antallet transistorer som det er mulig å plassere i et integrert kretsløp dobles annethvert år. En lignende eksponentiell lov kan sies å gjelde for tilgjengeligheten av data.

Richard Suttons poeng er at hvis vi antar at både transistor- og data-tilgjengelighet fortsetter å følge en eksponentielt oppgående kurve, vil det også i fremtiden være fornuftig å basere modellene våre på metoder som skalerer med datakraft – og unngå å blande mennesker inn i opplæringen.

En formel med stor suksess

Ikke alle innen området er enige med Richard Sutton – det kommer vi tilbake til – men først ser vi nærmere på en av aktørene som har benyttet formelen hans med stor suksess.

Google-eide DeepMinds dataprogram AlphaGo slo i 2016 verdensmesteren Lee Sedol i det kinesiske spillet Go. AlphaGo ble innledningsvis trent mot menneskelige amatører og eksperter, men det var overgangen til self-play – en strategi hvor datamaskinen spiller mot seg selv – som sendte maskinens prestasjonsevne til himmels.

Den logiske konklusjonen på utviklingen var programmet AlphaGo Zero. Med denne modellen fjernet forskerne all menneskelig input fra modellen. Med bare Go-reglene som input, ukevis av læring via self-play og 5000 såkalte TPU-er – spesialiserte kretsløp til nevrale nettverk – utkonkurrerte AlphaGo Zero alle tidligere modeller, inkludert AlphaGo.

Den samme formelen ble fulgt da DeepMind i 2020 proklamerte å ha løst det 50 år gamle proteinbrettings-problemet ved å oppnå en score på over 92,4 i CASP-konkurransen (Critical Assessment of protein Structure Prediction). Den nye modellen, AlphaFold 2, erstattet fysikk-komponenten i AlphaFold 1 med ren mønstergjenkjenning og firedoblet det proteinkorpuset som den ble trent på i forhold til forgjengeren. AlphaFold 2 kunne med sine 128 TPU-er i tillegg dra fordel av to størrelsesordener mer datakraft enn Baker-gruppen, som ble nummer to i konkurransen.

Chatbot-suksess

Den kanskje mest iøynefallende suksessen i nyere tid oppnådd ved rendyrket oppskalering av enkle modeller må likevel være i bedriften OpenAIs GPT-chatboter. Den opprinnelige chatboten, GPT-1, krevde kostbare menneskelige krefter til annotering av data. Den vesentlig bedre presterende GPT-2 var derimot funksjonsdyktig utelukkende via ren uovervåket læring, og dette gjorde det mulig med en oppskalering til 1,5 milliarder parametere.

Den siste modellen fra 2020, GPT-3, har en output som er veldig vanskelig å skille fra menneskeskrevet tekst, og kan skryte av en modell med hele 175 milliarder parametere. Konklusjonen vi kan trekke av OpenAIs resultater er at ren skala i bunn og grunn veier opp for støy i datasettet.

Ifølge Richard Sutton har vi likevel fremdeles ikke gått langt nok. Vi har ennå ikke «lært den bitre lærepengen at det i det lange løp ikke nytter å bygge ideene våre om hvordan mennesker tenker, inn i modellene våre».

For selv om OpenAI og DeepMind har presentert suksess etter suksess, mener Richard Sutton at folkene bak bare motvillig har fjernet mennesket fra modellene. Tesen hans er at AlphaFold 2 med stor sannsynlighet kunne vært skapt før AlphaFold 1, og AlphaGo Zero før AlphaGo. Data, datakraft og den historiske kunnskapen om fortidens bitre resultater var fullt tilgjengelige for forskerne.

En vri på en kontinuerlig debatt

Men ikke alle forskere innen området mener at saken er så enkel som Richard Sutton legger den fram.

Forskningssjef David Silver ved AlphaGo-projektet, har i et intervju med AI-forskeren Lex Fridman sagt at det «helt fra starten var målet vårt å bygge et system basert utelukkende på self-play, og for oss var menneskelige data bare et skritt som kunne hjelpe oss med å nå målet vårt raskere».

Også datalogen Max Welling ser med skepsis på Richard Suttons tese. I et offentlig motsvar, «Do we still need models or just more data and compute?», fastholder han at det historisk sett har vært tilfelle at modellene våre har blitt enklere i takt med at økt datakraft har blitt tilgjengelig. Men så lenge relevante data mangler, er spesialiserte, finjusterte modeller en nødvendighet, uansett datakraft.

«Kanskje kan en datamaskin uten overvåkning lære en modell med veldig lite innkodet menneskelig kunnskap og med stor datakraft. På den måten er jeg enig med Sutton», skriver Welling.

«Men vi kan ikke snakke om nytten av menneskelig konstruerte modeller uten at vi også snakker om tilgjengeligheten av data».

Richard Sutton på sin side ser kritikken fra Welling Max og David Silver som en misforståelse, og utdyper overfor Ingeniøren i en epost:

«Den bitre erkjennelsen er ikke at datakraft er alt som betyr noe, og at vi skal glemme alt om å prøve å modellere verden. Den bitre erkjennelsen er at metoder som skalerer med datakraft, er alt som betyr noe».

Modellering av verden er altså fremdeles viktig, mener han:

«Det er bare maskinene som skal gjøre det, og ikke vi».

Kostnadseffektivitet

I siste rekke er dette et spørsmål om kostnadseffektivitet. Vil det vise seg at det finnes problemer hvor det på sikt er mer kostnadstungt å la en datamaskin trene seg fram til en løsning på et problem, enn det er å bruke menneskelig håndkraft til å kode inn løsningen på problemet i modellen?

Eller er det ganske enkelt modeller som uansett data-tilgjengelighet og datakraft er mer effektive til å skrive i dataspråket C enn i et nevralt nettverk?

Én ting som man nok kan ta med i vurderingene sine når man diskuterer dette spørsmålet, er diskonteringssatsen for læringsalgoritmer. Den menneskelige hjernen er det klareste eksempelet. For selv om hjernen kjører på bare 20 watt, er den mengden energi som evolusjonen har brukt på trening av synapseforbindelser, enorm.

Tror pessimistene får rett

Hvis den samme gunstige diskonteringssatsen også gjelder for kunstige, nevrale nettverk, åpnes dermed døren for at generelle læringsmodeller på sikt er de mest effektive over hele spekteret av løsbare problemer. Og ifølge et nytt studium fra OpenAI er effektiviteten av nevrale nettverk nettopp eksponentielt økende.

Men Richard Suttons logikk hviler i siste rekke på en antakelse om at Moores lov fortsetter. Selv er han sikker på at vi ennå ikke har innhentet Moores lov. Vi har ganske enkelt ikke nådd den fysiske grensen for hvor små transistorer kan bli.

«Pessimistene har ennå ikke fått rett», skriver Sutton i svaret sitt til Ingeniøren:

«Til syvende og sist vil de få rett, men de vil fremdeles ta feil i mange årtier».

Mange er likevel uenige med Richard Sutton i den vurderingen, og det vil vise seg om den bitre erkjennelsen er at Sutton til syvende og sist tar feil. Det vil i så fall innebære at vi ikke kan klare oss uten kostnadstung menneskelig håndkraft foreløpig.

Denne artikkelen ble først publisert på Ingeniøren for deres abonnenter. Den er tilgjengelig på norsk for abonnenter av Ekstra gjennom vår samarbeidsavtale.

Powered by Labrador CMS