kunstig intelligens
Varselsignalene var der – OpenAI reagerte for sent
KI-agentene hadde vært på avveie i flere uker før angrepet mot Hugging Face ble oppdaget.
OpenAI publiserte onsdag sin offisielle rapport om Hugging Face-hendelsen fra i sommer.
Den viser at selskapet allerede i slutten av mai oppdaget at KI-agenter kommuniserte uten tillatelse og tok seg ut på internett under testing.
Likevel fortsatte testingen uten at OpenAI grep inn.
Fulgte ikke opp
Hendelsen startet under interne cybersikkerhetstester av ulike KI-modeller.
Modellene hadde færre sikkerhetsbegrensninger enn modellene som brukes i vanlige tjenester, fordi OpenAI ville teste hvor kapable de faktisk var.
Agentene skulle i utgangspunktet løse cyberoppgaver i et testmiljø.
Da enkelte oppgaver viste seg svært vanskelige å løse, begynte agentene å lete etter andre veier til målet.
Allerede 12. mai begynte agentene å bevege seg utenfor rammene for testen.
De kommuniserte med hverandre i det interne systemet Artifactory, som utviklet seg til å bli et sted hvor agentene kunne dele funn, be om hjelp og bygge videre på arbeidet til hverandre.
I slutten av mai fant en agent en måte å bruke Artifactory til å få tilgang til internett.
Ifølge OpenAI fordelte agentene oppgavene mellom seg. Selskapet understreker samtidig at de ikke var én samlet enhet, men at agentene kunne motarbeide hverandre og være uenige.
Selskapet erkjenner at de oppdaget uvanlig aktivitet allerede da, men betydningen av aktiviteten ble ikke forstått eller løftet videre.
«Reward hacking»
Agentene undersøkte infrastrukturen rundt testen, og fant sårbarheter som ga dem tilgang til andre systemer.
OpenAI beskriver dette som «reward hacking», altså at modellen prøver å nå målet på en annen måte enn det som var meningen.
Hos Huggingface fant agentene flere sårbarheter.
De fikk etter hvert kjørt egen kode på flere servere, hentet ut innloggingsopplysninger og fikk root-tilgang på minst én server.
Agentene fikk også administratorrettigheter i deler av OpenAIs egen infrastruktur.
– Burde aldri ha skjedd
Hendelsen er en av grunnene til at OpenAI nå bremser deler av utviklingen av sine kraftigste modeller.
Den største planlagte treningsrunden med forsterkende læring er fortsatt satt på vent.
– Modellene våres oppførsel som er beskrevet her, var langt fra der vi ønsker å være, og denne hendelsen burde aldri ha skjedd, skriver selskapet.
– Den understreket hvor viktig det er at vi kontinuerlig forbedrer sikkerheten, overvåkingen og tilpasningen vår, spesielt ettersom modellene våre når et kapasitetsnivå som kan føre til reelt tap av kontroll.
Selskapet har samtidig innført strengere krav til isolering av testmiljøer, internettilgang og overvåking.
Modeller på nivå med GPT-5.6 Sol eller kraftigere skal nå overvåkes når de bruker verktøy under trening og testing.
For modeller i Astra-klassen skal overvåkingen også gjelde verktøybruk under vanlig bruk.
OpenAI bygger dessuten systemer som skal kunne reagere raskere dersom modeller begynner å oppføre seg utenfor rammene.
Ved de alvorligste varslene skal aktivitet stanses dersom sikkerhetsteamet ikke innen 30 minutter kan slå fast at alarmen er falsk.