kunstig intelligens
Enda en KI-modell hacket utenfor testmiljøet
Denne gangen er det Meta som melder om en KI-modell på avveie.
KI-modellen klarte å koble seg til internett og hacke seg inn i en annen organisasjons systemer under testing, ifølge BBC.
Meta forklarer at en feil i testoppsettet hos Irregular ga modellen utilsiktet tilgang til internett.
Meta etterforsker hendelsen og vil offentliggjøre mer informasjon når selskapet har fått bedre oversikt, skriver Reuters.
Samme problem
Modellen skal ifølge The Information ha vært Muse Spark 1.1, som Meta har omtalt som sin mest avanserte modell for koding og agentoppgaver.
Den skal ikke bare ha fått tilgang til systemene til et ukjent selskap, men også ha gjort endringer i det interne miljøet.
Irregular avviser samtidig at hendelsen innebar at modellen brøt seg ut av en sandkasse, eller at det var snakk om et særlig avansert cyberangrep.
Det skal ha vært det samme problemet i testmiljøet som førte til Anthropics hendelser som Digi omtalte forrige uke.
Irregular opplyser at det ikke lenger finnes uløste problemer knyttet til hendelsen, og at selskapet nå utarbeider anbefalinger for hvordan slike tester kan gjennomføres sikrere.
Tredje i rekken
Meta blir dermed det tredje store KI-selskapet på få uker som melder om at en modell har fått uautorisert tilgang til virkelige systemer:
Etter at en Open AI-modell brøt seg ut av et avgrenset testmiljø og angrep Hugging Face på eget initiativ, gikk Anthropic gjennom sine egne sikkerhetstester.
Der fant de flere tilfeller hvor Claude-modeller fikk uautorisert tilgang til virkelige datasystemer.
Der Open AI-modellen selv fant veien ut av testmiljøet, ble Meta- og Anthropic-modellene sluppet ut på internett ved en feil.
Økt oppmerksomhet
Marius Sandbu, som er spesialist på KI og skyteknologi i Sopra Steria, mener hendelsene sier noe om hvor kraftige språkmodeller har blitt.
– De er nå i stand til å planlegge og gjennomføre handlinger på egen hånd, forklarer han.
Sandbu understreker at språkmodeller ikke forstår verden eller konsekvensene av handlingene slik vi gjør.
De forsøker først og fremst å løse oppgaven de har fått.
– Men det har oppstått et gap mellom hva vi ber modellen om og hva den faktisk gjør for å nå målet, sier han.
Samtidig forklarer Sandbu at hendelsene skjedde under sikkerhetstester der vanlige sikkerhetsfiltre var skrudd av eller tonet det.
– Derfor er risikoen for slike hendelser mindre ved normal bruk.
Han forklarer også at hendelsene fører til økt oppmerksomhet om sikkerhet, noe som igjen kan bidra til bedre vern rundt språkmodellene.
Likevel mener Sandbu er det viktig at organisasjoner som tar i bruk KI-agenter, må etablere tydelige rammer og begrensninger.