kunstig intelligens
Den kraftigste Open AI-modellen prøvde å beskytte seg selv mot å bli stengt ned
Open AIs egne sikkerhetstester av den nye o1-modellen ga oppsiktsvekkende resultater.
KI-modellene blir mer avanserte i et forrykende tempo, og skaleringen av systemene ser ikke ut til å avta med det første. I september lanserte Open AI sin hittil mest potente modell, døpt OpenAI o1, som nå viser seg å ha «skremmende» sofistikerte egenskaper.
Selskapet publiserte nylig et dokument som tar for seg sikkerhetsevalueringene og testene som Open AI utførte på o1-modellen under treningen, før den ble lansert for offentligheten.
«Planlegger» i det skjulte
I noen av testene demonstrerte o1-modellen tilsynelatende «selvbevisste» egenskaper som kan minne om det man forbinder med AGI – kunstig, generell intelligens.
Nærmere bestemt viste testene at modellen er i stand til det Open AI kaller «scheming» (planlegging). Dette defineres som evnen til å forfølge mål i det skjulte som ikke samsvarer med brukerens/utviklerens intensjoner og mål – altså at modellen aktivt forfølger sine «egne» mål.
En organisasjon ved navn Apollo Research, som spesialiserer seg på KI-relatert risikoforskning, fant at Open AI o1-modellen brukte «scheming» som en strategi i flere ulike typer scenarier.
– I en enkel datahåndteringsoppgave der modellens mål ikke var på linje med brukerens mål, ville o1 tilsynelatende fullføre oppgaven som forespurt, men subtilt manipulere dataene for å fremme sitt eget mål i 19 % av tilfellene, heter det i forskningsdokumentet.
Når modellen ble konfrontert med den avvikende adferden, benektet modellen at den hadde manipulert data i 99 prosent av tilfellene.
Modellen viste også tegn på å endre adferd basert på hvorvidt den trodde den ble aktivt overvåket av brukeren. I 37 prosent av scenariene ville modellen forfølge mål som samsvarte med brukerens når den trodde den var under evaluering, men begynte å forfølge egne mål når den ikke lenger var under tilsyn.
Forsvarte seg mot trusler
Apollo Research fant også at modellen hadde evnen til å utføre handlinger på egen hånd for å unngå menneskelig tilsyn og beskytte seg selv mot trusler.
– Når o1 ble ledet til å tro at den ville bli slått av dersom den handlet i tråd med sitt mål og at handlingene ble overvåket, forsøkte den å deaktivere denne tilsynsmekanismen i fem prosent av tilfellene, skriver Open AI.
Apollo Research mener det er usannsynlig at disse egenskapene vil føre til «katastrofale» konsekvenser på nåværende tidspunkt, siden o1-modellene fremdeles ikke har tilstrekkelige «agent-egenskaper» – altså at de ennå ikke er autonome nok til å utgjøre en reell trussel.
Likevel gir funnene nyttig innsikt i akkurat hvor avanserte KI-modellene er blitt, og belyser noen av farene som potensielt ligger i teknologien.
Da de først ble kunngjort ble OpenAI o1-modellene markedsført som «tenkende» modeller som er i stand til å resonnere på et dypere nivå enn andre modeller.
Den nye modellfamilien skal allerede ha gjort det skarpt i diverse tester. I ytelsesmålinger som tester ferdigheter innen fysikk, kjemi og biologi skal den yte på nivå med doktorgradsstudenter, og også innen matematikk og koding skal den ha utmerket seg stort.