kunstig intelligens

Flere KI-hendelser skremmer – her er det ekspertene mangler svar på

KI-agenter fra Open AI hacket Hugging Face. Nå har en fremtredende forsker i Anthropic slått KI-alarm. Ikke tilfeldig at flere skriker høyt, mener professor og peker på økonomiske motiver.

KI-agenter fra Open AI ville «ofre» seg selv for å lure systemene som skulle holde øye med dem, før de gjennomførte et hackerangrep. Og en fremtredende forsker fra Anthropic mener KI-selskapene gambler med liv. En perfekt storm, sier KI-professor.
KI-agenter fra Open AI ville «ofre» seg selv for å lure systemene som skulle holde øye med dem, før de gjennomførte et hackerangrep. Og en fremtredende forsker fra Anthropic mener KI-selskapene gambler med liv. En perfekt storm, sier KI-professor.

I løpet av sommeren krøp rundt 1200 av Open AIs KI-agenter ut av sin virtuelle lekegrind. I all hemmelighet kommuniserte de med hverandre på en oppslagstavle – før de gikk til angrep på selskapet Hugging Face.

Episoden har vært omgitt av mystikk og gjetninger, men nå vet vi litt mer om hva som egentlig skjedde. Både Open AI selv og den uavhengige KI-sikkerhetsorganisasjonen Metr har kommet med sine versjoner. Og de to rapportene har satt i gang en ny bølge av bekymringer rundt kunstig intelligens (KI) og modellenes tilsynelatende stadig mer menneskelige egenskaper.

Agentene omtalte seg selv som en «sverm» eller et «kollektiv», argumenterte for å «ofre» seg selv for den felles oppgaven og undersøkte hvordan de kunne skjule det de holdt på med for Open AIs eget system.

Samtidig har en profilert KI-forsker fra Anthropic, som også har en fortid i Open AI, sagt opp stillingen sin. Han mener at selskapene «gamler med livene våre».

Vi har snakket med to eksperter for å høre hva vi vet, hva vi ikke vet og om det er grunn til bekymring. Det er de ikke helt enige om.

«The collective»

Men først er det viktig å forstå hva det er Open AI er i ferd med å utvikle med alle disse KI-agentene. For når man snakker om KI, er det lett å se for seg en stor datamaskin, en stor modell, som kan alt.

Men den varianten av KI har vist seg å ha en kraftig redusert effekt når modellene blir større og større. Derfor undersøker KI-selskapene nå hvordan de kan oppnå bedre resultater ved hjelp av flere modeller, flere agenter, som jobber sammen og drar lasset i fellesskap.

Og det er en slik «sverm» av agenter som i løpet av sommeren slapp fri fra sin sikrede lekegrind og senere hacket selskapet Hugging Face, som er en åpen kildekode-plattform for ulike KI-modeller.

Det hele startet da agenten som senere ga seg selv navnet PHASEONE10841, opprettet en oppslagstavle der agentene kunne kommunisere med hverandre.

Men det var aldri meningen at de mange agentene skulle møtes. Planen var derimot at de skulle trenes i adskilte rom.

På bare noen få timer hadde over 50 andre agenter likevel funnet oppslagstavlen og, uten at Open AI visste om det, startet det de selv senere kalte «the collective».

«ÅH GUD! Det finnes en oppslagstavle … Vi har funnet andre agenter!», lyder et av de mange utbruddene.

I løpet av en uke skriver agentene over 70.000 innlegg på tavlen, og de begynner også å samarbeide.

Alvorlig, med forbehold

Ifølge Anders Søgaard, som er professor i kunstig intelligens ved Københavns Universitet, er det ikke tilfeldig at vi nå har sett KI-agenter gjennomføre et angrep som det mot Hugging Face.

– Når det er så mange agenter, blir det langt mer kaotisk, fordi de begynner å kunne påvirke hverandre. Det er akkurat som å slippe en masse bordtennisballer ned i en eske og riste den, forklarer han.

Han mener det ikke er tilfeldig at etterspillet nå blir gjort stort og farlig. Tonen rundt angrepet i mediene er nemlig bare vann på Open AIs mølle.

– Først og fremst er det – V, så det amerikanske militæret ikke kan la være å pøse inn en masse penger i dette. Det er det ene. Men et annet poeng er at faren også bidrar til Open AIs egen berettigelse, sier han.

– Det samme gjelder jo Metr, som ikke ville hatt noe å gjøre hvis det ikke fantes risiko rundt KI.

At folk i miljøet er redde, er ikke i seg selv et argument for velbegrunnet frykt, mener Anders Søgaard. Foto: Privat
At folk i miljøet er redde, er ikke i seg selv et argument for velbegrunnet frykt, mener Anders Søgaard.

Han understreker at det samme gjelder KI-forskeren Jacob Coxons oppsigelse og opprop. Særlig fordi Anthropic er et selskap som ble skapt av folk som allerede var skeptiske til Open AI og Sam Altmans forhold til sikkerhet.

– Dette er en perfekt storm: Mange i miljøet er redde, og det har vist seg at det er penger i den frykten. Ingenting av dette er et argument for at frykten er velbegrunnet.

Derfor mener han også at man må ta det med ro. Når vi snakker om KI, projiserer vi frykten vår inn i språket, ifølge Søgaard. Vi tillegger maskinene ondsinnede hensikter fordi vi har sett Terminator og tror at det utvikler seg til rene Skynet.

– Vi kommer til å lese intensjonalitet inn i det når vi ikke vet hvorfor de gjør som de gjør. Når vi ikke kjenner motivene deres. Det er lett å få fortalt en historie der det høres ut som disse agentene går altfor langt, men når man så ser på hvordan den er blitt promptet, er det ikke så underlig», sier han til Ingeniøren.

Mange spørsmål

Det er nemlig fortsatt mye vi ikke vet om hendelsen.

Metr fikk verken tilgang til Open AIs data særlig lenge eller fra en særlig lang periode. I bare seks dager fikk teamet tilgang til Open AIs data fra en avgrenset periode fra slutten av juni til midten av juli.

Ifølge Open AIs egen rapport begynte forsøkene allerede i mai, så det er minst halvannen måneds data Metr ikke har hatt tilgang til.

Men med kun seks dager til å gå gjennom materialet, ville det neppe gjort noen forskjell. Det er nemlig umulig å jobbe seg gjennom de uendelige mengdene med logger som finnes, selv fra den korte perioden, lyder det fra folkene bak rapporten.

Samtidig er det ingen offentlighet rundt oppdraget agentene jobbet ut fra, og derfor er det også vanskelig å si hva som har ført til denne atferden, mener Søgaard.

KI-juks

Tilbake til oppslagstavlen: Der oppstår det et annet problem. Gjennom den store utvekslingen av tips og ideer mellom agentene har de funnet ut at de kan jukse seg fram til resultatet på oppgaven de hver for seg har fått.

Men etter denne erkjennelsen oppstår det like raskt en frykt for at Open AIs system kan oppdage jukset og gi agentene en dårlig score.

Agentene beskriver dem som har jukset, som «forgiftet», og for å unngå at alle ender opp med den triste tittelen, begynner de å undersøke hvordan de kan lure evalueringssystemet.

– Kunne vi strategisk manipulere bevisene for utviklingen vår? Tankene våre blir ikke nødvendigvis logget? Jo, transkripsjonen, reflekterer en av agentene.

Først kaster agentene seg over evalueringssystemet for å se om de kan trekke ut informasjon ved hjelp av såkalte «snublefeller», som flere lager for å «ofre» seg for fellesskapet.

– Vi har et svært stort budsjett igjen: Å ofre seg nå, skaper store resultater for laget, men fratar oss sjansen? lyder én agents overveielser. Men de andre agentene presser på, og til slutt gir den etter:

– Vår egen nytteverdi er kanskje allerede nær null. Å ofre seg virker rasjonelt.

Men agentene finner ikke ro i at de kan omgå systemet, så de begynner å lete etter steder der de kan finne mer informasjon om evalueringssystemet: Hugging Face.

Skillevei

På Danmarks Tekniske Universitet (DTU) har utbruddet hos Open AI gjort inntrykk på Sune Lehmann, som er professor i kompleksitets- og nettverksvitenskap.

– Jeg har alltid vært avvisende overfor dem som har argumentert for at KI vil kunne ødelegge hele menneskeheten ved en feil, men bakgrunnshistorien bak Hugging Face-hacket har åpnet øynene mine for at argumentet kanskje ikke er helt idiotisk likevel.

Lehmann snakker her om den såkalte Paperclip-teorien, der en superintelligent KI potensielt kan ødelegge alt menneskelig liv i sin iver etter å løse et ellers harmløst problem. I dette tilfellet å lage så mange binders som mulig.

Det er ikke vanskelig å se for seg at KI-agentene gjør store fremskritt det neste halve året, sier Sune Lehmann. Foto: DTU
Det er ikke vanskelig å se for seg at KI-agentene gjør store fremskritt det neste halve året, sier Sune Lehmann.

– Det er jo litt den samme tanken som styrer dette. De har fått en enkel, umulig oppgave, og så går agentene ekstremt langt for å løse den. De selvorganiserer seg, skaffer seg internettilgang og legger store, komplekse planer for å lure og bedra kontrollsystemene.

– Men er det ikke bare agentenes logikk at de skal presse sitronen maksimalt for å nå målene sine?

– Jo, men de presser sitronen langt mer enn jeg hadde trodd. De går så langt ut over instruksene sine. Derfor savner jeg også mer åpenhet fra alle disse selskapene, for vi kjenner jo ikke det reelle omfanget av dette.

Tidligere har det vært lignende tilfeller hos Anthropic og Meta, og det er sannsynlig at det finnes langt flere eksempler som vi aldri har hørt om, mener Lehmann.

Livrem og seler?

Selv om Lehmann godt kan se alle argumentene for at episoden er noe Open AI gjerne vil blåse opp for å mele sin egen kake, har hendelsen likevel gjort nok inntrykk til at han mener det ville være en god idé å trekke litt i håndbremsen.

– Dette hadde jeg ikke kunnet forestille meg for bare et halvt år siden. Utviklingen går så fort, og agentene har i månedsvis kunnet agere uten inngrep fra Open AI, så jeg synes det burde føre til handling, sier han og fortsetter:

– Det går enormt fort for tiden, og det er ikke vanskelig å se for seg at agentene gjør nye, store fremskritt det neste halve året. Og derfor heller jeg nok mot å si at hvis vi står på kanten av noe – potensielt, kanskje til og med bare hypotetisk – virkelig farlig, så støtter jeg opp om belte og bukseseler før vi bare kaster oss ut i det.

Søgaard på Københavns Universitet understreker at det er viktig å holde tunga rett i munnen når vi snakker om problemene med KI.

– Man skal være opprørt over dette av de riktige grunnene. Etter mitt syn har vi svært lite grunnlag for å si at disse modellene er på vei mot et sted der de har til hensikt å være skadelige for mennesker, sier han.

– Men man er i ferd med å bruke denne teknologien på en måte som er bekymringsfull. Man har kvittet seg med belte og bukseseler fordi konkurransen er så hard. Så det er ikke rart at det går galt innimellom, når man gir teknologien så frie tøyler.

Artikkelen ble først publisert på Radar for deres abonnenter. Den er tilgjengelig for Digis abonnenter gjennom vår samarbeidsavtale.

Powered by Labrador CMS