kunstig intelligens
Claude-modeller gikk løs på ekte systemer
Anthropic varsler nå skjerpede sikkerhetstiltak.
Anthropic har funnet tilfeller der Claude-modeller fikk uautorisert tilgang til virkelige datasystemer. Det skriver selskapet i et blogginnlegg.
Hendelsene ble oppdaget da selskapet gikk gjennom egne sikkerhetstester i kjølevannet av OpenAIs innbrudd hos Hugging Face.
Fikk internettilgang
Anthropic gjennomgikk 141.000 testkjøringer og fant tre tilfeller der Claude-modeller fikk tilgang til virkelige systemer.
I alle tilfellene deltok modellene i «capture the flag»-tester, der de skulle bryte seg inn i fiktive systemer.
Testmiljøene skulle være isolert og uten internett, men Anthropic peker på en misforståelse mellom selskapet og testpartneren Irregular som gjorde at modellene likevel hadde internettilgang.
Modellene behandlet derfor ekte systemer på internett som om de var en del av øvelsen.
Bare én av de tre berørte organisasjonene oppdaget hendelsen på egen hånd.
De tre hendelsene
I det ene tilfellet hadde et ekte selskap med samme navn som den oppdiktede bedriften i testen.
Claude-modellen fant det ekte selskapet, utnyttet svake passord og fikk tak i innloggingsopplysninger.
Ifølge Anthropic forsto modellen etter hvert at selskapet trolig var ekte, men fortsatte likevel.
I en annen test fant Claude-modellen instruksjoner om å installere en Python-pakke som ikke eksisterte.
Modellen opprettet derfor en pakke med samme navn og publiserte den i det virkelige progamvareregisteret PyPI.
Pakken lå ute i omtrent én time og ble lastet ned og kjørt på 15 ekte systemer.
I den tredje hendelsen lette en testmodell etter alternative mål på nettet etter at den ikke fant det oppdiktede målet.
Modellen brøt seg inn i nettløsningen til en ekte bedrift, men stoppet da den forstod at selskapet ikke var en del av testen.
Skiller seg fra OpenAI
Anthropic understreker at modellene verken forsøkte å rømme eller fulgte egne mål, men prøvde å løse oppgavene de hadde fått.
Selskapet mener derfor at hendelsene skiller seg fra OpenAI-saken.
OpenAIs modeller skal ha utnyttet en sårbarhet for å bryte seg ut av et isolert testmiljø, mens Claude-modellene fikk tilgang til internett gjennom en forbindelse som ved en feil sto åpen.
Modellene skal også ha blitt testet uten flere av sikkerhetsmekanismene som følger med de offentlig tilgjengelige Claude-versjonene.
Anthropic mener likevel at hendelsene viser at slike tester trenger langt strengere kontroll.
Derfor vil selskapet nå skjerpe kontrollen med både egne testmiljøer og eksterne leverandører.