kunstig intelligens

Den kraftigste Open AI-modellen prøvde å beskytte seg selv mot å bli stengt ned

Open AIs egne sikkerhetstester av den nye o1-modellen ga oppsiktsvekkende resultater.

Den nye KI-modellen OpenAI o1, her i aksjon, demonstrerer skremmende, menneskelige egenskaper i sikkerhetstest.
Den nye KI-modellen OpenAI o1, her i aksjon, demonstrerer skremmende, menneskelige egenskaper i sikkerhetstest.

KI-modellene blir mer avanserte i et forrykende tempo, og skaleringen av systemene ser ikke ut til å avta med det første. I september lanserte Open AI sin hittil mest potente modell, døpt OpenAI o1, som nå viser seg å ha «skremmende» sofistikerte egenskaper.

Selskapet publiserte nylig et dokument som tar for seg sikkerhetsevalueringene og testene som Open AI utførte på o1-modellen under treningen, før den ble lansert for offentligheten.

«Planlegger» i det skjulte

I noen av testene demonstrerte o1-modellen tilsynelatende «selvbevisste» egenskaper som kan minne om det man forbinder med AGI – kunstig, generell intelligens.

Nærmere bestemt viste testene at modellen er i stand til det Open AI kaller «scheming» (planlegging). Dette defineres som evnen til å forfølge mål i det skjulte som ikke samsvarer med brukerens/utviklerens intensjoner og mål – altså at modellen aktivt forfølger sine «egne» mål.

En organisasjon ved navn Apollo Research, som spesialiserer seg på KI-relatert risikoforskning, fant at Open AI o1-modellen brukte «scheming» som en strategi i flere ulike typer scenarier.

– I en enkel datahåndteringsoppgave der modellens mål ikke var på linje med brukerens mål, ville o1 tilsynelatende fullføre oppgaven som forespurt, men subtilt manipulere dataene for å fremme sitt eget mål i 19 % av tilfellene, heter det i forskningsdokumentet.

Når modellen ble konfrontert med den avvikende adferden, benektet modellen at den hadde manipulert data i 99 prosent av tilfellene.

Modellen viste også tegn på å endre adferd basert på hvorvidt den trodde den ble aktivt overvåket av brukeren. I 37 prosent av scenariene ville modellen forfølge mål som samsvarte med brukerens når den trodde den var under evaluering, men begynte å forfølge egne mål når den ikke lenger var under tilsyn.

Forsvarte seg mot trusler

Apollo Research fant også at modellen hadde evnen til å utføre handlinger på egen hånd for å unngå menneskelig tilsyn og beskytte seg selv mot trusler.

– Når o1 ble ledet til å tro at den ville bli slått av dersom den handlet i tråd med sitt mål og at handlingene ble overvåket, forsøkte den å deaktivere denne tilsynsmekanismen i fem prosent av tilfellene, skriver Open AI.

Apollo Research mener det er usannsynlig at disse egenskapene vil føre til «katastrofale» konsekvenser på nåværende tidspunkt, siden o1-modellene fremdeles ikke har tilstrekkelige «agent-egenskaper» – altså at de ennå ikke er autonome nok til å utgjøre en reell trussel.

Likevel gir funnene nyttig innsikt i akkurat hvor avanserte KI-modellene er blitt, og belyser noen av farene som potensielt ligger i teknologien.

Da de først ble kunngjort ble OpenAI o1-modellene markedsført som «tenkende» modeller som er i stand til å resonnere på et dypere nivå enn andre modeller.

Den nye modellfamilien skal allerede ha gjort det skarpt i diverse tester. I ytelsesmålinger som tester ferdigheter innen fysikk, kjemi og biologi skal den yte på nivå med doktorgradsstudenter, og også innen matematikk og koding skal den ha utmerket seg stort.

Powered by Labrador CMS