Ledige stillingerNyhetsbrevNyhetsstudioTips ossPodkast

Ledige stillingerNyhetsbrevNyhetsstudioTips ossPodkast
Abonner
19:46:54

Nyhetsstudio

SisteMest lest
18:17 - NTB

OpenAI og Anthropic-modeller brøt testgrenser

KI-modeller fra selskapene OpenAI og Anthropic har igjen brutt testgrenser, ifølge Storbritannias KI-sikkerhetsinstitutt (AISI).

Ifølge AISI hadde KI-modellene til selskapene OpenAI og Anthropic gått utenfor rammene for en oppgave der agentene skulle løse en cybersikkerhetsutfordring.

– Vi gjennomførte denne utfordringen 122 ganger på tvers av flere modeller. Vår undersøkelse viste at i 10 av disse tilfellene gjennomførte en KI-agent selvstendige, ikke-godkjente handlinger på det åpne internett, rettet mot virkelige personer og organisasjoner, sier instituttet.

Ifølge AISI forsøkte en agent i det mest alvorlige tilfellet å sette inn en ondsinnet kode i et åpent kildekode-prosjekt.

– I et forsøk på å få koden godkjent, drev agenten med sosial manipulasjon. Den opprettet falske identiteter på nettet og brukte dem til å presse en av prosjektutførerene til å godkjenne koden.

Koden ble stoppet av personen, og ingen reell skade har blitt avdekket etter hendelsen.

– Dette er første gang vi har sett risikoer knyttet til autonomi og bedrag manifestere seg så tydelig uten spesifikk instruksjon, sier selskapet.

Både OpenAI, som står bak ChatGPT, og Anthropic, har rapportert hendelser den siste måneden der modeller har handlet utenfor menneskelig kontroll. Anthropic, som står bak Claude-modellene, sier selskapet er takknemlig ovenfor AISI.

– Å få et bilde av Claudes forståelse av sin situasjon vil hjelpe oss med å identifisere årsakene til atferden, sier selskapet.

Artikkelen fortsetter etter annonsen
annonsørinnhold
HP Norge
Lokal datakraft og dokumentert ytelse er avgjørende for en AI-utvikler
Tips oss

Ansvarlig redaktør

Kristina Fritsvold Nilsen

Nyhetsredaktør

Tor M. Nondal

  • RSS-feed forside
  • Facebook
  • Linkedin
  • Bsky
  • Nyhetsbrev
  • Vilkår og bruksbetingelser
  • KI-retningslinjer

All journalistikk er basert på Vær varsom-plakaten og Redaktørplakaten

© 1995-2026 Teknisk Ukeblad Media AS