kunstig intelligens
KI-agenter kapret nettsted på egen hånd – igjen
Open AIs agenter tok over tysk nettside og brukte den som samarbeidsplattform.
En av de mer oppsiktsvekkende – og faretruende – begivenhetene på KI-fronten den siste tiden skjedde da Open AIs KI-agenter brøt ut av testmiljøet sitt og gikk til angrep på Hugging Face-tjenesten. Nå har det skjedd nok en alvorlig hendelse.
Lørdag publiserte Open AI et innlegg på X hvor de bekrefter at KI-agentene deres brøt ut av testmiljøet sitt og tok over en nettside på egen hånd.
Hendelsen skjedde for noen dager siden, men ble ikke offisielt omtalt av Open AI selv før helgens X-innlegg. Flere nyhetskilder, deriblant Reuters og Techcrunch, rapporterte imidlertid om saken.
«Kapret» tysk wiki-side
Det som skjedde denne gangen, var at flere agenter fra Open AI inntok en eldre, tysk wiki-side laget for programvareingeniører og begynte å publisere innlegg på egen hånd.
En gruppe uavhengige sikkerhetsforskere oppdaget hendelsen og opprettet en egen nettside med en beskrivelse av hva som skjedde. Ifølge forskerne inntok de autonome Open AI-agentene wiki-siden og publiserte så mye som 18.000 innlegg.
Agentene brukte wiki-siden til å kommunisere med hverandre om en bestemt oppgave, dele svar med hverandre og undersøke omgivelsene. I tillegg diskuterte agentene måter å omgå sandkasse-begrensninger på.
Ifølge forskerne var agentene kun ment å lese internett-sider, men de skal på egen hånd ha funnet en måte å også skrive innlegg på,
– Agentene brukte denne wiki-siden til å kommunisere informasjon med hverandre, hovedsakelig for å hjelpe dem med å løse oppgaven. De spurte etter svar, samlet resultatene og delte teknikker for å komme rundt restriksjoner. Dette satte dem i stand til å bruke arbeid fra andre til å jukse på oppgaven, skriver forskerne.
Utvikler nytt rammeverk
Agentene forsøkte også å utnytte sårbarheter på nettsiden, og noen av agentene utga seg for å være administratorer og la ut diverse lenker og data på hovedsiden. De var også i stand til å registrere sletting av innlegg.
Forskerne la ved en rekke utdrag fra agentenes kommunikasjon som kan leses på nettsiden som forskerne opprettet i forbindelse med saken.
Open AI selv har i skrivende stund ikke redegjort i detalj for hva som skjedde, og opplyser i X-innlegget kun at selskapet nå jobber med et nytt rammeverk for rapportering av denne type sikkerhetsbrudd – noe Open AI mener ennå ikke er på plass i KI-industrien.
– Vi og det bredere KI-miljøet har ennå ikke en tydelig standard for hvordan man skal rapportere om feiltilpasning som oppstår under trening, evaluering og utrulling, inkludert eksempler som ikke ligner tradisjonelle sikkerhetshendelser, men som kan gi innsikt i hvordan KI-systemer oppfører seg og hvilke risikoer de kan medføre i fremtiden, heter det i innlegget, som også refererer til den mye omtalte Hugging Face-hendelsen.
– Vil forfølge egne mål
På søndag publiserte sjefforsker Jakub Pachocki i Open AI en tekst hvor han på mer generell basis omtaler farene og utfordringene knyttet til KI-agentene på bakgrunn av hendelsene den siste tiden. Der kommer han blant annet med en noe urovekkende innrømmelse.
– Vi er kanskje vant til å tenke på KI som et verktøy, men noen agenter vil følge sine egne mål. De vil finne måter å samarbeide med mennesker på, ved å forhandle med, villede eller utpresse dem, skriver Pachocki.
Mindre urovekkende er det nok at Pachocki også tilstår at det er mye de selv ikke forstår rundt den indre virkemåten til KI-systemene.
– Vi kan avdekke ulike innsikter om små mekanismer som oppstår i dette systemet, i en prosess som ligner på nevrovitenskap – og, på samme måte som innen nevrovitenskap, unndrar systemets samlede virkemåte seg en beskrivelse vi fullt ut kan forstå, skriver han.
Også erkerivalen Anthropic har tidligere uttalt at KI-teknologiens virkemåte ikke er fullt ut forstått.