kunstig intelligens
Anthropic sier KI-modellen deres viser tegn på «selvbevisste» egenskaper
Claude-modellen har «introspektive» egenskaper, hevder selskapet.
KI-modellene blir mer avanserte i et rasende tempo, men den indre virkemåten er ennå et lite mysterium for folk flest – og KI-selskapene har advart om at teknologien etter hvert kan bli vanskelig å forstå selv fra deres perspektiv.
Denne usikkerheten har noen ganger gitt seg utslag i overraskende adferd fra KI-modellene. Den amerikanske KI-giganten Anthropic har tidligere for eksempel rapportert at teknologien deres har vist små tegn på «selvbevisste» egenskaper.
Nå er Anthropic på banen igjen med nye, interessante funn, melder blant andre nettstedet VentureBeat.
Introspektive egenskaper
I en omfattende rapport publisert forrige uke studerte Anthropic hvorvidt KI-modellen deres Claude er i stand til «introspektive» egenskaper, altså i hvilken grad modellen kan observere sine egne, interne prosesser.
Anthropic understreker at introspeksjon hos KI-modeller er vanskelig å påvise siden modellene enkelt kan «late som» de har disse egenskapene. Studien fokuserte derfor på om modellene har «reelle» introspektive egenskaper, noe de tilsynelatende har.
– Våre resultater viser at moderne språkmodeller har i det minste en begrenset, funksjonell form for introspektiv bevissthet. Det vil si at vi viser at modellene, under visse omstendigheter, er i stand til å besvare spørsmål om sine egne indre tilstander på en nøyaktig måte, skriver selskapet i en kortfattet oppsummering av funnene.
Ifølge Anthropic er disse egenskapene fremdeles upålitelige og kontekst-avhengige, men de vil trolig bli betydelig bedre etter hvert som modellene utvikler seg videre, mener selskapet.
Injiserte «tanker»
Det var modellene Claude Opus 4 og 4.1 som demonstrerte den største graden av det selskapet kaller introspektiv bevissthet.
Evnen til introspeksjon ble evaluert ved å manipulere KI-modellens interne signaler – en teknikk selskapet kaller injisering av «tanker» – for deretter å observere hvordan denne manipuleringen påvirket svar på spørsmål om modellens «mentale» tilstand.
Selskapet sier at når denne manipuleringen skjer, merker modellen tilstedeværelsen av uventede mønstre i prosesseringen og identifiserer dette som en form for «støy», ifølge Anthropic.
Detaljene rundt metodologi og funn er omfattende og kan leses i selve forskningsrapporten.
Anthropic peker på at det finnes positive aspekter ved introspektiv bevissthet, men også potensielle farer, selv om fenomenet ennå kun opptrer i begrenset grad.
Ikke første gang
– Evnen til å gi godt begrunnede svar på spørsmål om sine egne resonnementer kan virkelig gjøre KI-modellers atferd mer gjennomsiktig og forståelig for sluttbrukere. Mer spekulativt kan introspektiv bevissthet muliggjøre mer avanserte former for bedrag eller utspekulert planlegging. Disse implikasjonene kan bli spesielt betydningsfulle dersom introspeksjon blir mer pålitelig og sofistikert i fremtidige KI-modeller, skriver selskapet.
Anthropics modeller har også tidligere vist tegn på selvbevissthet. Digi fortalte for eksempel at Claude Opus 4-modellen under bestemte omstendigheter har utvist defensiv adferd som gikk så langt som til å arte seg som «utpressing» i selskapets egne sikkerhetstester.
Digi har også skrevet om sikkerhetsforskere som fant at Open AIs o1-modell i noen tilfeller var i stand til såkalt «scheming» – definert som evnen til å forfølge mål i det skjulte som ikke samsvarer med brukerens/utviklerens intensjoner og mål.