artikler

Etter 80 år har AI lært seg å spå fremtiden

Nyteknik forteller historien om kunstige nevrale nettverk – fra Alexander Bain til Microsoft Bing.

Frank Rosenblatt demonstrerer forløperen for dagens dype nevrale nettverk, Mark 1 Perceptron.
Frank Rosenblatt demonstrerer forløperen for dagens dype nevrale nettverk, Mark 1 Perceptron.

ChatGPT. Bing. Bard.

Potensialet i de nye chatbotene er svimlende og tar oss med inn i en ny verden. Der maskiner har erobret noe vi trodde var dypt menneskelig: språket. Der det er vanskelig å få oversikt over hvordan livene våre vil endre seg.

De er kulminasjonen av en utvikling som begynte på 1940-tallet og ideer som er 150 år gamle.

I fem deler forteller Nyteknik historien om kunstige nevrale nettverk – fra Alexander Bain til Microsoft Bing.

Del en: Historien

Moderne kunstig intelligens kan skape tekst som er så overbevisende at den ikke bare har praktisk nytteverdi, men også kan framstå som menneskelig. Det som skjer, er at AI-programmet – eller store språkmodeller – ut fra en inputtekst forsøker å forutse og å generere neste ord. Det er kjernen i både Open AIs ChatGPT, Microsofts Bing og Googles Bard. Men å svare på hvordan de gjør det, og hva som har ført fram til dette øyeblikket, krever sin egen forklaring. La oss først skru klokken 65 år tilbake.

En AI-modell New York Times skrev om, skulle være så lik et menneske at den knapt kunne kalles en maskin. Ifølge forsker Frank Rosenblatt fra Cornell Aeronautical Laboratory i New York kunne den lære om nye miljøer og gjenstander, uten noen forkunnskaper. Rosenblatt mente den godt kunne komme til å utvikle bevissthet. Artikkelen ble publisert 13. juli 1958.

En artikkel om «perceptron», publisert i New York Times i 1958. Faksimile: New York Times
En artikkel om «perceptron», publisert i New York Times i 1958. Faksimile: New York Times

Den modellen Frank Rosenblatt hadde utviklet, ble kalt perceptron og ble brukt på stordatamaskinen IBM 704 og senere på Mark 1 Perceptron som var skreddersydd for formålet. Forløperen til perceptron var beskrevet av to forskere i Chicago, Walter Pitts og Warren McCulloch.

Pitts og McCulloch var inspirert av en idé som kan spores tilbake til 1873 og den skotske filosofen Alexander Bain. Den gangen hadde vitenskapen, takket være nye mikroskoper, fått ny kunnskap om hjernen. Den bestod av nevroner koblet sammen i et nettverk. Forskerne så at hver nervecelle kunne sende ut signaler til mange andre.

Det var input og output

Bain foreslo at informasjon ble skapt i selve forbindelsen mellom nevronene. Ulike kombinasjoner av input kan gi ulik output. Eller sagt på en annen måte: ulike beregninger kunne finne sted. Walter Pitts og Warren McCulloch bygget videre på dette og presenterte i 1943, for første gang i historien, det vi i dag kaller et kunstig nevralt nettverk.

Men før Mark 1 Perceptron ble lansert, ga den kanadiske psykologen Donald Hebbs et et viktig teoretisk bidrag. Hebbs postulerte at hvis nevron A gjentatte ganger stimulerer nevron B, vil koblingen – eller vekten – mellom A og B forsterkes. Det viser seg, som Hebbs uttrykte det, at «celles that fire together, wire together».

Denne teorien er ikke nok for å forklare hvordan hjernen fungerer, men den spilte en viktig rolle for Frank Rosenblatts perceptron, og den er minst like aktuell i dag. Forløperen til ChatGPT, GPT-3, har 175 milliarder parametere. Og parametere er bare et annet ord for de koplingene – vektene – Hebbs beskrev. Mark 1 Perceptron bestod av en modell der signaler ble matet inn, ble vektet og genererte en output. Chat CPT består av en modell der signaler mates inn, vektes og genererer en output.

Det er imidlertid fire store forskjeller: datamengder, regnekraft, algoritmer og dype nettverk. Rosenblatts perceptron bestod av to lag (input og output), mens moderne nevrale nettverk kan bestå av i hundrevis av lag. Perceptronen var et grunt nevralt nettverk, men moderne nevrale nettverk er dype. Derav begrepet dyplæring, eller deep learning.

Tross den optimistiske artikkelen i New York Times, fikk ikke Rosenblatts maskin til så mye mer enn å avgjøre om kvadrater på hullkort befant seg på høyre eller venstre side av en linje. Optimismen falmet snart. Det første av flere «AI-vintre» fulgte, preget av betydelig skepsis. De nevrale nettverkene havnet i skyggen av såkalt symbolsk AI, som krever mer menneskelig innsats. I flere tiår var denne tilnærmingen nærmest enerådende innen kunstig intelligens. I dag har de nevrale nettverkene tatt helt over, og symbolsk AI kalles i dag GOFAI (good old-fashioned AI).

Del to: gjennombruddet

Alt endret seg 2012, da datapioneren Geoffrey Hinton og to av elevene hans, Alex Krizhevsky og Ilya Sutskever, gjorde noe ingen trodde var mulig. Trioen lot Alexnet, en ny AI-modell de hadde utviklet, delta i en konkurranse om å klassifisere millioner av bilder. At modellen reduserte antallet av feil med 20 prosent, lyder kanskje ikke så dramatisk, men forskere rundt om i verden var målløse.

Forskningen hoppet plutselig 20 år framover i tid.

– Tradisjonelt falt antall feil med mindre enn en prosent per år. Plutselig hoppet forskningen 20 år framover i tid. Det åpnet slusene, har forskeren Terrence Sejnowski sagt til The Verge.

Så hvordan fungerer et dypt nevralt nettverk? Det finnes mange metoder og tilnærminger, så her ser vi på det store bildet. La oss si at vi vil ha en modell som kan identifisere katter på bilder. Modellen mates med bilder og går grundig til verks: Den begynner på pikselnivå. Hver piksel har en verdi som beskriver farge og lysstyrke. Nodene – nevronene – i nettverket gjør en analyse av disse verdiene, som sendes videre til nodene i neste lag, som ut fra analysen begynner å identifisere egenskaper – mer og mer komplekse og spesifikke. Fra piksler til linjer og teksturer til noe som, for en datamaskin, er veldig abstrakt: en katt.

Dette vil aldri fungere på første forsøk. AI-modellen feilmargin er for høy. Kunstig intelligens har en læringskurve, akkurat som mennesker.

Så den begynner på nytt. Igjen og igjen. AI-forsker kaller dette for treningsfasen.

Hver node i nettverket er forsynt med en verdi basert på en matematisk funksjon. Altså en vekt. Vektene, eller parametrene, justeres helt til modellen gir en output som er så nær fasiten som mulig. Da kan modellen tas i bruk.

Geoffrey Hinton var lenge nesten alene om å forvalte arven fra Pitts, McCulloch og Rosenblatt. Suksessen for Alexnet i 2012 krevde imidlertid noe mer enn utholdenhet. Noen år tidligere hadde grafikkortprodusenten Nvidia lansert Cuda, en plattform som gjorde det mulig å kjøre andre programmer enn dataspill på selskapets grafikkprosessorer. Og nesten samtidig arbeidet Fei-Fei Li, en forsker ved University of Illinois Urbana-Champaign, med en enestående bildedatabase, Imagenet. Det Imagenet som lot Alexnet kickstarte den moderne AI-revolusjonen. Ved hjelp av kraftige GPU-er gikk det raskere å trene Alexnet, og modellen kunne ta i bruk 60 millioner parametere, noe som på den tiden var utrolig mange. I tillegg hadde Hinton, Krizhevsky and Sutskever utstyrt Alexnet med flere nye funksjoner. Datamengde, regnekraft, algoritmer og dype nettverk: Alt falt på plass.

Snart sto Google, Microsoft, Baidu og nystartede Deepmind på kø for å verve Hinton, Krizhevsky og Sutskever. Google trakk det lengste strået – og noen år senere kjøpte søkekjempen også Deepmind.

På 2010-tallet den ene triumfen avløst den andre. Deepminds AI-modeller har beseiret verdens beste utøvere i det kompliserte brettspillet Go og knekt den proteinfoldingsgåten som vitenskapen har slitt med i nesten 50 år. Dyplæring brukes til bilde- og ansiktsgjenkjenning, medisinsk forskning, politiarbeid, autonome kjøretøyer og utallige andre applikasjoner.

Men på et gikk utviklingen saktere: naturlig språk. Selv om kunstig intelligens hadde blitt noe alle bedrifter, industrier og nasjoner måtte forholde seg til, kunne den nesten ikk lese og skrive. Virtuelle stemmeassistenter var preget av kortfattede svar, og de kunne ikke svare på oppfølgingsspørsmål.

Gjennombruddet kom med en vitenskapelig artikkel med en oppsiktsvekkende overskrift: «Attention is all you need». Oppmerksomhet er alt du trenger. Forskerne fra Google hadde, da artikkelen ble publisert 2017, antagelig ikke drømt om hvor mye oppmerksomhet den skulle få. At den skulle gjøre at hele verden begynte å snakke om kunstig intelligens.

Del tre: Oppmerksomhet

Tekst og språk er «langdistanseavhengig». En forfatter kan plante et frø på en side og la det blomstre mange kapitler senere. En konversasjon kan begynne ett sted, ta ulike retninger og så komme tilbake til utgangspunktet. Tekst er avhengig av sammenhenger og ordstilling. «Katt jager mus» og «mus jager katt» består av samme ord, men betyr to ulike ting. Betydningen av ord som «klikke» og «mus» kommer helt an på sammenhengen.

Alexnet bestod av en så kalt CNN (convolutional neural network). Den arkitekturen egner seg godt for bildeklassifisering, der hvert enkelt lag «sveiper» over bildet for å finne mønstre, som i sin tur mates inn i påfølgende lag. Det endelige resultatet representerer hva pikslene forestiller. Man kan si at lagene fungerer lokalt. De har kontakt med lagene over og under, men ikke hva som skjer lengre unna.

Derfor sliter CNN-modeller med tekst. Forskere forsøkte å fikse problemet med RNN (recurrent neural network) og LSTM (long short-term memory), to andre typer dype nevrale nettverk. De ble lenge betraktet som state-of-the-art, men framgangen var beskjedne.

Nvidias DGX A100system brukes blant annet til svenske superdatamaskinen Berzelius. Den svenske språkmodellen GPT-SW3 trenes ved hjelp av Berzelius. Foto: Argonne National Laboratory

Med «Attention is all you need»-artikkelen foreslo Google-forskerne – sammen med forskere fra University of Toronto – noe radikalt. De eliminerte ganske enkelt lokale koplinger: Nå skulle alle bestanddelene i nettverket granskes samtidig. Modellen kunne fokusere på alle nodene og identifisere relevante mønstre og sammenhenger. Oppmerksomhet var, som sagt, alt man trengte. Ja, oppmerksomhet og – igjen – de siste grafikkprosessorene. Før det hadde det ikke vært mulig å implementere denne ekstremt parallelliserte arkitekturen.

Og forskerne hadde enda en ny idé. De kodet inn informasjon om posisjon for hvert ord (eller, hvis for å være presis, ved hver token – modellen ser egentlig ikke på hele ord, men på mindre bestanddeler).

– Oppmerksomhet er viktig, men når det gjelder språk, er rekkefølge avgjørende informasjon, sier Ariel Ekgren, forsker ved AI Sweden.

Opprinnelig var forskernes målsetting å forbedre maskinoversatt språk. Det er lett å glemme, men for seks år siden hadde kunstig intelligens store problemer å fungere som tolk. Oversettelsesprogrammene fungerte greit. Den nye arkitekturen endret alt. Siden attention – oppmerksomhet – var den avgjørende ingrediensen, valgte forskerne å døpe det til Attention Net.

– Men var ikke noe spennende navn, har Ashish Vaswani, en tidligere Google-forsker som ledet arbeidet med modellen, sagt i en artikkel på Nvidias nettsted.

I stedet fikk den navnet transformer. Det var egentlig ingen grunn til det, annet enn at Vaswani og de andre syntes at hørtes bra ut.

– Jeg argumenterte for at vi transformerte representasjoner, men det var bare semantikk, har han sagt.

Med tiden skulle navnevalget bli profetisk.

Del fire: Store språkmodeller

Omtrent et år før «Attention is all you need»-artikkelen hadde Ilya Sutskever – han som utviklet Alexnet sammen med Geoffrey Hinton og Alex Krizhevsky – bestemt seg for å etablere et nytt selskap, sammen med blant andre Sam Altman. Med Alexnet hadde Sutskever forandret verden, men samtidig hadde det kommet advarsler. Satt på spissen er kunstig intelligens en trussel. Den svenske filosofen Nick Boströms bok Superintelligens ble en bestselger. Den påpekte at det var vanskelig å styre AI.

Da de startet det nye selskapet, publiserte Sutskever og de andre gründerne et manifest. «Vi mener at AI skal være en forlengning av menneskelivet og, i en liberal ånd, at AI skal distribueres så bredt og rettferdig som mulig». Ville ikke la teknologikjempene ta kontroll over den kunstige intelligensen. Selskapet fikk navnet Open AI.

Som nesten alle andre som arbeidet med kunstig intelligens begynte Open AI – etter «Attention is all you need» artikkelen – å eksperimentere med transformerarkitektur. 1800-tallsfilosofen Alexander Bain hadde foreslått at informasjon ble skapt gjennom forbindelser mellom nevroner. Ashish Vaswani, som ledet arbeidet med transformerteknologien, har sagt «at mening oppstår som et resultat av relasjonen mellom ting, og oppmerksomhet er en generell måte å lære om relasjonene». Med Open AI-modellen GPT-3 – forløperen til ChatGPT – ble det tydelig at det ikke bare var tomme ord.

GPT-3 står for den tredje versjonen av «generative pre-trained transformer». At den er «pre-trained» innebærer at modellen trenes uten noe spesifikt mål. GPT-2, lansert 2019, hadde blitt matet med 40 gigabyte data, blant annet massevis av romaner, og var utstyrt med imponerende 1,5 milliarder parametere (altså vekter). Bare et år senere hadde Open AI skapt et veritabelt monster. Med 175 milliarder parametere var GPT-3 ti ganger større enn noen annen transformermodell på det tidspunktet. Den var matet med 570 GB data og nesten en billion ord. Man begynte å snakke om LLM, altså large language models. Store språkmodeller.

At flere parametere gir et bedre resultat, er rimelig. Ariel Ekgren fra AI Sweden bidrar med en enkel analogi.

– Hvis oppgaven er å tegne en trekant, men du får bare tegne en strek, blir det et vanskelig. Hvis du får bruke to streker, kan du i det minste tegne et hjørne. Det sier noe om betydningen av flere parametere.

Del fem: Generalisering

Det Frank Rosenblatt hadde drømt om med sin perceptron, virket plutselig innen rekkevidde. New York Times (og alle andre) skrev igjen om kunstig intelligens, men denne gangen fikk avisen hjelp til å skrive artikkelen – av GPT-3.

Det mest oppsiktsvekkende er ikke at GPT-3, ChatGPT, Bing, Bard – og en million andre du vil støte på de neste årene – kan forutsi neste ord i en tekst, men hva den evnen fører til. Den fører til generalisering. Hvis du ber en stor språkmodell å skrive poesi, gjør den det. Hvis du oppfordrer den til å generere kode, gjør den det. Hvis du ber den summere de siste årenes AI-gjennomgrudd i en tabell, gjør den det raskere enn du rekker å åpne Excel. Den gjør det uten at noe menneske har gitt den opplæring i disse spesifikke oppgavene.

Sarah Mody fra Microsoft demonstrerer chattbotversjonen av Bing under et møte i bedriftens hovedkvarter i Redmond i Washington i februar 2023. Foto: Jason Redmond/afp/TT

Dessuten er det enkelt å finjustere modellene etter behag. Allerede i mars 2021 fortalte Open AI at modifiserte versjoner av GPT-3 eksisterte i over 300 applikasjoner og sysselsatte titusenvis av utviklere. Ifølge en artikkel i The Economist driver 80 prosent av alle AI-forskere i dag med transformerarkitektur.

Chatbotene forklarer selv

Transformerarkitektur, oppmerksomhet og posisjonskoding kan være vanskelig å forstå. Så vi bad ChatGPT og Bing om å forklare. Vi lot for moro skyld ChatGPT generere teksten på engelsk og lot deretter Bing oversette. Teksten er redigert.

«Transformermodeller er en type dyplæringsalgoritme som brukes for å bearbeide og forstå menneskelig språk. De har blitt det åpenbare valget for et bredt spektrum av oppgaver innen blant annet maskinoversettelse, sentimentanalyse og tekstgenerering.

Man kan tenke på en transformermodell som en intelligent språktolk. Den tar imot en setning, bryter den ned i enkeltord og ser på hvert ord i sammenhengen for å bestemme hva den betyr. Det er her begrepet oppmerksomhet spiller en viktig rolle.

Oppmerksomhet er som et team av eksperter som vurderte hvert ord i en setning for å finne forholdet til de andre ordene. Hver ekspert fokuserer på ett ord om gangen og vurderer relasjonene til alle andre ord i setningen. Denne informasjonen brukes for å bygge opp en fullstendig forståelse av setningen.

I tillegg til oppmerksomhet bruker transformermodeller posisjonskodinger for å holde orden ordene i en setning. Dette er som å gi teamet av eksperter et kart som viser rekkefølgen av ord i setningen, noe som sikrer at modellen kan forstå sammenhengen mellom ordene.»

Det kan være fristende å tilskrive språkmodellene evner de ikke har. Det bare spår neste ord, og vil ofte hallusinere, som AI-forskere kaller det. Uten noe begrep om hva som er sant eller usant kan modellene – velformulert og med stor overbevisning – finne på hva som helst. Det gir skeptikere godt med ammunisjon.

Likevel går utviklingen bare i én retning. Nesten alle organisasjoner lurer nå på hvordan transformerteknologi kan gi dem et overtak, eller i det minste la dem overleve. At ChatGPT utløste en eksistensiell krise innad i Google, sier en del om potensialet. Hvorfor google når man kan stille spørsmål og oppfølgingsspørsmål til en chatbot?

Språkmodeller er et begrep som kan gi inntrykk at teknologien bare kan brukes i tekstsammenhenger. Transformerarkitektur har derimot, som det kalles på forskerspråk, multimodale egenskaper. De kan generere bilder, video og 3d-grafikk. Deepmind brukte dem til å forutsi proteinsekvenser med AI-modellen Alphafold, og Astra Zeneca undersøker hvordan relasjonen mellom atomer kan løse kjemiske mysterier. Nylig har Microsoft demonstrert hvordan man kan koble en språkmodell med bilder og lyder. De oppsummerte arbeidet i en artikkel med en ikke særlig subtil overskrift: «Language is not all you need: aligning perception with language models».

– Det er en grense for mengden input til en språkmodell: all tekst som er tilgjengelig i verden. Det høres naturligvis helt sprøtt ut, men vi er nok ikke så langt unna. Da må man ta i bruk video eller andre ting for å gjøre modellene bedre, sier Ariel Ekgren.

De allsidige egenskapene i transformerarkitekturen gjør at forskere på Stanford University har foreslått at de skal kalles «foundation models». Grunnleggende modeller som kan brukes til, og kombineres med, mange forskjellige domener.

Om dette til slutt fører til AGI, generell kunstig intelligens, der en maskin er like kognitivt kapabel, like flink til å løse problemer, som et menneske? Det er det heftig debatt om blant AI-forskere. Skeptikere som Gary Marcus og Yann LeCun (en AI-pioner som nå leder Metas forskning på området) tror det kreves flere paradigmeskifter og nye typer arkitektur. Andre, som Eliezer Yudkowsky, er mer bekymret for utviklingen de siste månedene. At Microsofts Bing i sin første uke som chatbot påviste en urovekkende atferd, er et faresignal, mener Yudkowsky. En enda mer intelligent modell, med adgang til flere systemer, kunne forårsake store skader.

Det er noe Open AI har skrevet om i et nytt manifest, publisert for bare noen uker siden, under overskriften «Planning for AGI and beyond». Men bedriftens direktør, Sam Altman, tror det går bra. «Vi kan», skriver han, «tenke oss en verden der menneskeheten blomstrer på et nivå som antagelig er umulig å forestille seg».

Artikkelen ble først publisert på Nyteknik for deres abonnenter. Den er tilgjengelig på norsk for abonnenter av Ekstra gjennom vår samarbeidsavtale. .

AI-uttrykk

Dype nevrale nettverk. Løst modellert etter kognitive prosesser i hjernen. En type maskinlæring. Og maskinlæring er en type kunstig intelligens.

CNN. Convolutional neural network. En type arkitektur for dype nevrale nettverk. Velegnet for blant annet bildegjenkjenning.

Transformer. En arkitektur som først ble beskrevet i 2017. Bygger på attention/oppmerksomhets-arkitektur (se under).

LLM. Large language model (stor språkmodell). Den tilnærmingen som er mest kjent når det gjelder transformerarkitektur. GPT-3 – forløperen til ChatGPT – har 175 milliarder parametere (se under).

Attention/oppmerksomhet. Moderne grafikkprosessorer (gpu) gjør det mulig å kjøre beregninger parallelt. Den kan feste oppmerksomheten på inputdataene samtidig, snarere en og en.

Vekter/parametere. Hver node/nevron i nettverket hører sammen med en tallverdi som kan justeres – vektes. Vektenes kan justeres mange ganger under treningfasen.

Posisjonskoding. For språk er ordstillingen viktig. Derfor har en stor språkmodell etiketter for hvert ord (eller token, som kan være mindre bestanddeler av et ord).

Powered by Labrador CMS