kunstig intelligens

KI-modell hacket selskap på eget initiativ: – Blir skeptisk når de store KI-leverandørene ikke har kontroll

Open AIs siste KI-test viser hvor raskt avanserte modeller kan utnytte sårbarheter, mener Marius Sandbu. Han advarer om at virksomheter må tette sikkerhetshull betydelig raskere enn i dag.

Marius Sandbu, som er spesialist på KI og skyteknologi i Sopra Steria, mener det er langt ifra siste gang vi kommer til å se et semiautomatisk angrep fra en KI-modell.
Marius Sandbu, som er spesialist på KI og skyteknologi i Sopra Steria, mener det er langt ifra siste gang vi kommer til å se et semiautomatisk angrep fra en KI-modell.

En av Open AIs KI-agenter brøt seg ut av et isolert testmiljø under en test og fikk tilgang til det åpne internettet, hvor den hacket oppstartsbedriften Hugging Face på eget initiativ, forteller selskapet.

Marius Sandbu, som er spesialist på KI og skyteknologi i Sopra Steria, sier til Digi at det er første dokumenterte tilfelle av et slik type angrep.

– Forrige uke annonserte Hugging Face at de hadde blitt utsatt for et angrep mot sin infrastruktur, uten at de visste hvem det var. Det de derimot visste, var at de hadde blitt utsatt for et angrep fra virtuelle agenter. Det var interessant at det var et automatisert angrep som har blitt gjennomført, sier han.

Hendelsen var forårsaket av modellen GPT-5.6 Sol, samt en enda kraftigere modell som ennå ikke er lansert.

Modellene ble testet internt, hvor de ble bedt om å utføre avanserte utnyttelsesangrep, med mål om å måle hvordan de håndterer cybertrusler.

I forsøket på å få tilgang til det åpne nettet, oppdaget og utnyttet modellene hittil ukjente nulldagssårbarheter.

Open AI skriver i en uttalelse at de anser denne hendelsen som en «cyberhendelse uten sidestykke», som involverer cyberkapasiteter på aller høyeste teknologiske nivå.

– Selv om angrepet kanskje ikke nødvendigvis var teknisk avansert, og kunne blitt avverget med enkle basis sikkerhetsfunksjoner, blir man litt skeptisk når de store KI-leverandørene som Open AI ikke har kontroll på egen infrastruktur og tjenester, sier Sandbu.

Advarer

Han sier at utgangspunktet var at Open AI hadde satt i gang en evalueringssprosess for å bygge neste generasjons språkmodell, mest sannsynlig GPT 6.

– Da de satte i gang evalueringsprosessen, ble den startet opp i et isolert miljø hos Open AI med mye av de innebygde sikkerhetsfunksjonene i språkmodellene skrudd av, der språkmodellen skulle evaluere kriteriene på ulike benchmarker, blant annet en type som heter Exploitgym, forklarer han.

Språkmodellen fant ut at hvis den skal bli bedre og score høyere på tester, måtte den finne svarene, sier Sandbu. Mye av datagrunnlaget til testene ligger hos Hugging Face.

– Modellen fant ut på egenhånd at hvis den skal finne ut hvor svarene ligger, måtte den bryte seg ut av det isolerte miljøet hos Open AI. Så fant og utnyttet den en rekke nye sårbarheter for å kunne skaffe seg tilgang til datasettet hos Hugging Face.

Sam Altman er administrerende direktør i OpenAI, som er mest kjent for å stå bak Chat GPT. Foto: Kylie Cooper/Reuters/NTB
Sam Altman er administrerende direktør i OpenAI, som er mest kjent for å stå bak Chat GPT.

Hugging Faces sikkerhetsteam og KI-agenter oppdaget selv aktiviteten og stanset den. Selskapet samarbeider med Open AI for å undersøke hendelsen, blir det opplyst.

Open AI advarer samtidig om at slike hendelser vil bli vanligere etter hvert som KI-modellene blir stadig mer avanserte.

– Vi deler foreløpige funn allerede nå for å hjelpe forsvarere og sikkerhetsmiljøer med å forstå hva som skjedde, og for å gi et mer realistisk bilde av hva dagens KI-modeller faktisk er i stand til, skriver Open AI i uttalelsen.

Dårligere tid

Sandbu sier at nye, kraftige KI-modeller betyr at vi må bruke mye kortere tid på å få på plass nye sikkerhetsoppdateringer.

Vi må også ha evne til å håndtere mange flere sårbarheter i digital infrastruktur enn før.

– Veldig ofte kommer det sikkerhetsoppdateringer en gang i måneden eller litt oftere fra de store leverandørene, og så installerer vi dem i et definert vedlikeholdsvindu som er kontrollert og planlagt. Nå har vi ikke tid til det lenger, sier Sandbu.

Trusselmessig sier han at disse verktøyene er et forsterkende element.

– Hvis du har en person med litt teknisk kompetanse som ønsker å gjøre noe kriminelt for økonomisk vinning, har vedkommende nå plutselig en stor verktøykasse som kan brukes til å gjøre hva som helst.

Sandbu understreker at KI-selskapene, som Open AI, Anthropic og Google, legger til sikkerhetsfunksjoner for å forhindre at dette skal skje.

– Samtidig skjer det en del utvikling i Kina med språkmodeller som ikke har like gode innebygde sikkerhetsfunksjoner, noe som gjør at de enklere kan brukes til negative formål.

Utligner forspranget

Open AI omtaler GPT-5.6 Sol som den sterkeste modellen de har lansert hittil, og som flaggskipmodellen i GPT-5.6-serien.

Modeller som GPT-5.6 Sol er i økende grad stand til å gjennomføre komplekse, flertrinns cyberoperasjoner over lange tidsperioder.

KI-modeller som klarer å finne og utnytte sårbarheter i programvare bedre enn tidligere modeller, og som utnytter nulldagssårbarheter, ble et stort samtaletema etter at Anthropic lanserte Claude Mythos i vår.

Mythos har blitt kalt den sterkeste KI-modellen noen sinne.

Sandbu sier at det nå stadig vekk kommer «mythosøyeblikk», da feltet er i konstant utvikling.

– Claude Mythos og GPT-5.6 Sol er nok omtrent på samme nivå. Det forspranget som Mythos hadde da den ble lansert, er tatt igjen for lenge siden, mener han.

– Til og med Kimi K3, som er verdens største open-source model og som ble lansert forrige uke, er også på samme nivå som Fable på mange områder.

Powered by Labrador CMS