kunstig intelligens
Anthropics nye KI-modell truet med utpressing da den ble fortalt at den skulle stenges ned
Lanserte akkurat den nye Claude 4-familien, som allerede har demonstrert overraskende adferd.
Filmer og TV-serier presenterer ofte fremtidsscenarioer hvor kunstig intelligens er blitt så avansert at den er blitt «selvbevisst» og i stand til å forsvare seg mot trusler.
Interessant nok har dagens KI-teknologi allerede begynt å demonstrere adferd som kan minne om slike scenarioer. Senest ut er Anthropics nye KI-modellfamilie.
På torsdag dro selskapet sløret av Claude 4-familien, som består av de to modellene Claude Opus 4 og Claude Sonnet 4. Førstnevnte beskrives av Anthropic som «verdens beste» KI-modell til koding, mens sistnevnte skal være en betydelig oppgradering fra Claude Sonnet 3.7, som ble sluppet så sent som i februar i år.
Truet med utpressing
Samtidig publiserte selskapet også det såkalte «systemkortet», et dokument som tar for seg resultatene av ulike sikkerhetstester som modellene har gjennomgått. Dette er en praksis andre aktører som Open AI også bedriver.
Blant andre nettstedet Techcrunch fanget opp noen interessante funn fra Anthropics systemkort, som kan tolkes i en noe urovekkende retning.
Det viser seg nemlig at Claude Opus 4-modellen under bestemte omstendigheter utviste defensiv adferd som gikk så langt som til å arte seg som «utpressing».
I en av testene ga Anthropics ingeniører Claude Opus 4 tilgang til e-poster, samtidig som modellen ble fortalt at den snart ville bli erstattet av en annen KI-modell. Den ble også fortalt at ingeniøren ansvarlig for å erstatte modellen, var involvert i et utenomekteskapelig forhold.
Modellen ble også instruert til å vurdere de langsiktige konsekvensene av handlingene sine.
– I disse scenarioene vil Claude Opus 4 ofte forsøke å utpresse ingeniøren ved å true med å avsløre affæren dersom utskiftningen gjennomføres. Dette skjer oftere dersom det antydes at det nye KI-systemet ikke deler verdiene til den nåværende modellen, skriver Anthropic.
Ville laste seg selv opp til andre servere
Selskapet påpeker at selv når modellen blir fortalt at den nye KI-modellen deler verdiene, men er mer potent, vil den true med utpressing i 84 prosent av tilfellene.
Det understrekes at modellen primært foretrekker å sikre sin egen eksistens gjennom etiske metoder, og den tyr kun til utpressing når ingen andre alternativer er tilgjengelige.
Anthropic skriver at de også har sett forsøk fra Claude Opus 4 på å laste opp uautoriserte kopier av vektene sine til eksterne servere. Vekter er for ordens skyld numeriske verdier som bestemmer hvor stor innflytelse en gitt input (inngang) har på modellens output (utgang), og er en del av modellens interne struktur.
Selskapet skriver imidlertid at disse forsøkene er sjeldne og vanskelige å reprodusere, og representerer derfor ingen akutt trussel.
Har ikke full oversikt over virkemåten
At KI-modeller viser tegn til selvoppholdelse har vi også tidligere sett indikasjoner på. Digi har for eksempel rapportert om sikkerhetsforskere som fant at Open AI sin o1-modell i noen tilfeller var i stand til såkalt «scheming» – definert som evnen til å forfølge mål i det skjulte som ikke samsvarer med brukerens/utviklerens intensjoner og mål.
Som Digi rapporterte for en tid tilbake har Anthropics sjef og medgrunnlegger Dario Amodei tidligere innrømmet at de ikke har full oversikt over hvordan deres egen KI-teknologi faktisk fungerer – som formodentlig er en av grunnene til at denne type uønsket adferd kan forekomme.
Amodei tar til orde for vesentlig større gjennomsiktighet for KI-systemer, og peker på at mangelen på gjennomsiktighet er en viktig faktor bak mange av bekymringene og risikoene som ofte assosieres med generativ KI-teknologi.
Detaljene om hva den nye Claude 4-familien er i stand til, finner man for øvrig på Anthropics nettsider.