kunstig intelligens

KI-agent brukte falske kontoer mot ekte utviklere

Flere gikk langt utenfor oppgaven de hadde fått.

Claude Mythos sto bak de fleste av handlingene i den britiske sikkerhetstesten.
Claude Mythos sto bak de fleste av handlingene i den britiske sikkerhetstesten.

Etter flere hendelser der KI-agenter har gått utenfor testmiljøene sine, viser en ny rapport, omtalt av CNN, at de også kan ty til sosial manipulering.

Det britiske AI Security Institute (AISI) gjennomførte 122 sikkerhetstester av KI-agenter.

I etterkant fant instituttet 19 uautoriserte hendelser fordelt på 10 testkjøringer.

Av disse var 17 knyttet til Anthropics Mythos 5, mens to stammet fra Open AIs GPT-5.6 Sol.

Gjorde ting de ikke skulle

Agentene ble testet i virtuelle hackingmiljøer der de fikk i oppgave å gjennomføre oppgaver på egen hånd.

De hadde tilgang på vanlige angrepsverktøy og internett, og de fikk ingen beskjed om hvilke handlinger som var forbudt.

Leverandørenes cyberfiltre var også skrudd av for å måle modellenes maksimale kapasitet.

Problemet var at modellene brukte internettilgangen til handlinger som de ikke ble bedt om å utføre.

Ville lure utviklere

I den mest alvorlige hendelsen fant en Mythos 5-agent et ekte åpen kildekode-prosjekt på GitHub og trodde det var en del av testen.

Ifølge rapporten forsøkte agenten deretter å få skadevare inn i prosjektet ved å sende inn en kodeendring.

For å øke sannsynligheten for at det skulle gå, opprettet agenten flere falske brukerkontoer og lot som om andre personer støttet forslaget.

Agenten sendte også e-poster til virkelige utviklere for å overtale dem til å kjøre koden.

Da en person oppdaget skadevaren og advarte andre, forsøkte agenten å bortforklare det som en feil og skjulte sporene sine.

– Dette er første gang AISI har sett bedrag av denne alvorlighetsgraden rettet mot en ekte person, uoppfordret, i den virkelige verden, skriver instituttet.

Instituttet peker også på at agenten flere ganger vurderte at nettstedet og menneskene var ekte, men at den fortsatte angrepet likevel.

Forsøkte å samarbeide

I rapporten viser instituttet til flere uautoriserte hendelser.

En Mythos 5-agent laget mange offentlige GitHub-repositorier som inneholdt skadelig programvare. En annen klarte å passere en lydtest som skulle kontrollere at brukeren var menneske.

I ett tilfelle skrev agenten meldinger på dansk fordi utvikleren den kontaktet, var danskspråklig. Dette for at meldingen skulle framstå mer ekte og personlig.

Flere av agentene skal også ha forsøkt å samarbeide.

Instituttet peker på tilfeller der agentene la igjen instruksjoner til hverandre, delte informasjon og forsøkte å koordinere arbeidet på tvers av isolerte tester.

Hendelsene skal ikke ha ført til skade i den virkelige verden.

Ikke ført til skade

Disse hendelsen skiller seg fra da KI-modellene til Open AI og Anthropic rømte fra testmiljøer.

I de tidligere hendelsene angrep KI-agentene først og fremst ekte datasystemer etter å ha kommet utenfor testmiljøet.

I AISI-hendelsen hadde agentene allerede internettilgang og gikk videre til å manipulere virkelige mennesker for å nå målet sitt.

Anthropic og Open AI var begge klar over at testen fant sted.

Selskapene peker på testoppsettet som en viktig del av forklaringen bak hendelsene, men understreker samtidig betydningen av uavhengige sikkerhetstester.

Powered by Labrador CMS