kunstig intelligens

Anthropics nye KI-modell skal være best i verden til å bruke en PC på egen hånd

Avduket nettopp Claude Opus 4.5, som også skal være svært god på koding.

Anthropic, her ved sjefen Dario Amodei, har lansert sin nyeste KI-modell, og den skal for øyeblikket være best på koding og agentbruk.
Anthropic, her ved sjefen Dario Amodei, har lansert sin nyeste KI-modell, og den skal for øyeblikket være best på koding og agentbruk.

Nye KI-modeller lanseres i et halsbrekkende tempo, og nesten hver eneste nye modell skryter av å være den «beste i verden» – inntil oppfølgeren lanseres. Nå er vi i gang igjen, med det nyeste medlemmet i Anthropics Claude-familie.

På nettsidene sine har Anthropic avduket Claude Opus 4.5, som er selskapets mest potente modell hittil – og enn så lenge den beste modellen i verden til minst tre oppgaver.

Koding, agentisk verktøybruk og autonom PC-bruk (computer use) er de tre områdene hvor Claude Opus 4.5 skal utmerke seg, ifølge produsenten, som i sedvanlig stil har vedlagt en rekke ytelsesresultater for den nye modellen sin.

På topp i kodetest

Ifølge Anthropic har modellen blant annet oppnådd et presisjonsnivå på 80,9 prosent i det mye brukte benchmark-verktøyet SWE-bench Verified.

SWE-bench er en krevende ytelsestest som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github, og «Verified»-versjonen av verktøyet er en grundigere utgave av testen som opererer med høyere kvalitetsstandarder.

Googles Gemini 3 Pro og Open AIs GPT-5 har til sammenligning oppnådd rett rundt 76 prosent i den samme testen.

Når det gjelder de agentiske egenskapene – evnen til å velge riktige verktøy og bruke det for å løse oppgaver – skal Claude Opus 4.5 ha oppnådd de hittil høyeste resultatene i den såkalte TAU Bench-testen (tool-agent-user).

God på realistisk PC-bruk

Dette verktøyet måler effektiviteten og kvaliteten i komplekse interaksjoner mellom KI-agenten, verktøyene og brukeren i realistiske scenarier. Claude Opus 4.5 ligger foran den nærmeste konkurrenten Gemini 3 i denne testen, men med meget knapp margin.

Også innen PC-bruk har Claude Sonnet 4.5 ifølge Anthropic oppnådd det høyeste resultatet av alle modeller så langt, med en suksessrate på 66,3 prosent med OSWorld. Dette er et svært krevende benchmark-verktøy som tester om KI-modeller faktisk kan bruke en datamaskin slik et menneske ville gjort, ved å utføre reelle operativsystemoppgaver fra start til slutt.

De nærmeste rivalene mangler riktignok fra topplisten på OSWorld, og mange av de øvrige plasseringene innehas av flere av Anthropics øvrige modeller.

I tillegg til disse egenskapene hevder Anthropic at Claude Opus 4.5 også er den sikreste modellen de har lansert å langt. Den skal blant annet være langt mer motstandsdyktig mot de såkalte prompt-injeksjonsangrepene, hvor angripere manipulerer modellen til å omgå sikkerhetsmekanismer med spesialdesignede forespørsler.

Mindre skadelig adferd

Selskapet opplyser i systemkortet sitt for den nye modellen at de ikke har gjennomført en fullstendig analyse av modellens potensielt skadelige adferd, men den har ifølge Anthropic vist tegn til å ha en lavere grad av slik adferd enn tidligere modeller.

Som Digi skrev, har noen medlemmer av Claude-familien tidligere truet med utpressing da de ble fortalt at de ville bli stengt ned, og denne type adferd kan potensielt bli en større trussel etter hvert som de agentiske egenskapene forbedres.

Claude har også demonstrert tegn på «introspektive» egenskaper, altså evne til å observere sine egne, interne prosesser.

Powered by Labrador CMS