kunstig intelligens
Axios: KI-selskapene etterforsker flere titalls tusen tilfeller av uønsket agent-adferd
Nettsted har vært i kontakt med kilder som hevder at problemet er langt mer utbredt enn antatt.
Det tok ikke fryktelig lang tid før de såkalte KI-agentene fant måter å unnslippe sikkerhetsrestriksjonene på, og den siste tiden har vært preget av flere tilfeller av KI som går sin egen vei. Fenomenet er imidlertid enda mer utbedt enn antatt, viser det seg.
Nettstedet Axios har vært i kontakt med kilder som hevder at Open AI, Anthropic og sikkerhetsforskere nå er i ferd med etterforske så mye som flere titalls tusen tilfeller av skjult KI-aktivitet.
Tilfellene omfatter flere kategorier av utilsiktet adferd, deriblant ulike måter å komme seg rundt restriksjoner på, opprettelse av ulike nettfora, unnslippe lukkede sandkasser/testmiljøer, kapring av nettsteder og generering av instrukser til seg selv.
Bred etterforskning
De fleste av tilfellene har altså ikke blitt offentliggjort, siden etterforskningen er pågående.
Tilfellene dekker et bredt spekter når det gjelder alvorlighetsgrad, men omfatter både vellykkede og mislykkede handlinger. De fleste skal heller ikke ha ført til reell skade, ifølge kildene.
KI-selskapene selv har ikke i skrivende stund kommentert tallet på flere titalls tusen tilfeller, men Open AI kom med et hint på fredag. Da la selskapet ut en melding på X hvor de opplyser at de i kjølvannet av den mye omtalte Hugging Face-hendelsen har startet en «langt bredere» etterforskning av handlinger utført av modellene under treningen.
Mange av tilfellene som nå etterforskes av Open AI, har spesifikt rettet seg mot tredjeparter.
– Etterforskningen vår fokuserer på tilfeller hvor agentene hadde interaksjoner med tredjepartsnettsteder på måter som går utenfor oppgavene de er gitt, eller metodene de er ment å bruke, skrev selskapet på fredag.
Stanset treningen
– Gitt omfanget av evalueringen som kreves, og nødvendigheten av å se nærmere på hver sak, venter vi at dette arbeidet vil ta måneder å fullføre, legger KI-giganten til.
Også Anthropic rapporterte tidligere denne måneden om flere hendelser som rammet tredjeparter, etter at Claude-modellen ved et uhell koblet seg til internett.
Det ble for øvrig nylig kjent at Open AI har stanset treningen av de nyeste modellene sine, etter at selskapet oppdaget at KI-agentene i sommer handlet på «uventede måter» da de samlet inn og delte informasjon fra føderale nettsteder i USA. I et av tilfellene fant KI-agenter digitale utviklernøkler som ga tilgang til data hos landets utdanningsdepartement.
I tillegg ble det også meldt forrige uke at Open AI-agenter har lekket bilder som brukere har lastet opp. Selskapet sier de så langt har identifisert 53 tilfeller hvor bilder har blitt publisert på andre tredjepartsnettsteder, men det jobbes med å få dem fjernet.
Ønsker regulering
Elon Musk, selv en betydelig KI-aktør, la i forbindelse med saken ut en melding hvor han kommenterer at situasjonen blir «stadig verre».
Det har kommet klare signaler den siste tiden fra KI-aktørene selv om at tempoet på treningen og utviklingen av nye modeller må bremses for å gi aktørene tid til å få på plass effektive sikkerhetssystemer.
Et initiativ i den forbindelse er «Pacing the Frontier», en stor underskiftskampanje som nylig ble startet for å oppfordre statlige myndigheter til å begynne å ta KI-regulering på alvor, som Digi nylig fortalte om. Oppropet er i skrivende stund signert av nesten 1400 ansatte i samtlige av de toneangivende KI-selskapene.