kunstig intelligens

Studie: Kraftig økning i kunstig intelligens som «går sin egen vei»

Antallet tilfeller av KI som oppfører seg i strid med brukernes intensjoner øker sterkt, sier forskere.

KI-teknologien blir stadig mer autonom, og det er ikke helt risikofritt, understreker en ny rapport.
KI-teknologien blir stadig mer autonom, og det er ikke helt risikofritt, understreker en ny rapport.

Etter hvert som kunstig intelligens klatrer til nye høyder, har det også begynt å dukke opp alarmerende funn når det gjelder teknologiens adferd – i form av tilsynelatende «selvbevisste» egenskaper.

Begge de to KI-gigantene Open AI og Anthropic har tidligere rapportert om tilfeller hvor deres respektive KI-modeller har vist tegn på å trosse menneskelige intensjoner for å følge sine egne mål i det skjulte – et fenomen som omtales som «scheming» i KI-miljøet.

Nå har det kommet en ny rapport som viser at fenomenet er mer utbredt enn først antatt – og sterkt økende. Avisen The Guardian skrev nylig om saken.

Økte nesten fem ganger over fem måneder

Rapporten ble utarbeidet av Centre for Long-Term Resilience, en uavhengig organisasjon som jobber med kartlegging av globale risikofaktorer, blant annet knyttet til kunstig intelligens. Finansieringen kom fra det britiske, statlige instituttet AI Security Institute.

Funnene er basert på analyser av over 180.000 transkripsjoner av brukerinteraksjoner med KI-systemer som ble delt på X-plattformen i perioden oktober 2025 til mars i år.

Forskerne identifiserte til sammen 698 tilfeller av «scheming», definert som hendelser hvor KI-systemene oppførte seg på en måte som ikke samsvarte med brukernes intensjoner og/eller utførte skjulte eller villedende handlinger på egen hånd.

– Vi finner bevis på flere tilfeller av manipulerende eller manipulasjonsrelatert atferd i reelle KI-implementeringer, som tidligere kun var rapportert i eksperimentelle omgivelser – mange av disse har ført til reelle skader, skriver forskerne.

Det slående ved funnene var den sterke veksten. I oktober 2025 ble det kun registrert 65 tilfeller av manipulasjonsadferd, mens i mars i år ble det funnet hele 319 tilfeller – som altså er en økning på nesten fem ganger i løpet av innsamlingsperioden.

Grafen viser økningen i «scheming»-tilfeller over en periode på fem måneder fra oktober i fjor. Foto: CLTR
Grafen viser økningen i «scheming»-tilfeller over en periode på fem måneder fra oktober i fjor.

– Ikke katastrofalt, men likevel alvorlig

Forskerne skriver at den sterke økningen sammenfaller godt med lanseringen av nye og mer avanserte «agentiske» KI-modeller fra de store aktørene – altså modeller som er designet for autonome egenskaper.

Ifølge forskerne indikerer funnene en alarmerende trend, selv om tilfellene så langt ikke representerer en full krise.

– Selv om vi ikke oppdaget katastrofale tilfeller av «scheming»-oppførsel, demonstrerer adferden vi observerte bekymringsfulle forløpere til mer alvorlige tilfeller, slik som villighet til å ignorere direkte instruksjoner, omgå sikkerhetsmekanismer, lyve til brukere og ensidig forfølge et mål på skadelige måter, heter det i oppsummeringen av funnene i rapporten.

De fleste autonome KI-agenter i dag benyttes til oppgaver hvor risikofaktoren er begrenset. Som forskerne peker på kan fremtidens KI-agenter imidlertid benyttes på områder hvor potensialet for å gjøre stor skade kan være svært høyt – for eksempel i militær sammenheng eller innen kritisk infrastruktur.

Anthropics modell tydde til «utpressing»

Risikoen som KI-teknologi utgjør innen autonome våpensystemer, er for øvrig noe aktørene selv er klar over, og var en av hovedgrunnene bak Anthropics berømte brudd med Pentagon.

Anthropic er et av KI-selskapene som har vært åpne om «scheming»-tilfeller hos sin egen Claude-modell. I sikkerhetstester av selskapets Claude Opus 4-modell, viste modellen tegn på selvoppholdelsesegenskaper ved at den truet med «utpressing» da den ble fortalt at den ville bli stengt ned.

Som Digi rapporterte for en tid tilbake har Anthropics sjef og medgrunnlegger Dario Amodei tidligere innrømmet at de ikke har full oversikt over hvordan deres egen KI-teknologi faktisk fungerer – som kan være en av grunnene til at denne type uønsket adferd kan forekomme.

Powered by Labrador CMS