kunstig intelligens

Anthropic hevder de har lansert verdens beste KI-modell til to viktige oppgaver

Anthropic sparer ikke på superlativene med sin seneste modell.

Anthropic, her ved sjef Dario Amodei, fortsetter å hevde seg i KI-konkurransen med en ny, potent modell.
Anthropic, her ved sjef Dario Amodei, fortsetter å hevde seg i KI-konkurransen med en ny, potent modell.

En av de mest fremadstormende rivalene til Open AI og Google på KI-arenaen er Anthropic, som har satt seg på kartet med sine høyst kompetente Claude-modeller. Nå har selskapet dratt sløret av sin seneste nykommer, og den skal være ganske så muskuløs.

Anthropic kaster all beskjedenhet til side og kaller simpelthen sin nye Claude Sonnet 4.5-modell for verdens beste modell til både koding og til å bruke en datamaskin på egen hånd – det som gjerne kalles «agentiske» egenskaper.

Topplassering innen koding

De djerve påstandene underbygges blant annet av resultatene som Claude Sonnet 4.5 har oppnådd i det mye brukte benchmark-verktøyet SWE-bench Verified.

SWE-bench er en krevende ytelsestest som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github, og «Verified»-versjonen av verktøyet er en enda grundigere utgave av testen som opererer med høyere kvalitetsstandarder.

I denne testen skal Claude Sonnet 4.5 ha oppnådd et presisjonsnivå på 77,2 prosent. Dette er et lite hestehode foran konkurrenten Open AI sin GPT-5 Codex (74,5 prosent) og et større hestehode foran Googles Gemini 2.5 Pro (67,2 prosent).

Claude Sonnet 4.5 gjorde det skarpt i SWE-bench-testen, hevder Anthropic. I tillegg til rivalene fra Google og Open AI er det Anthropics egne modeller som ligger nærmest i ytelse. Foto: Anthropic
Claude Sonnet 4.5 gjorde det skarpt i SWE-bench-testen, hevder Anthropic. I tillegg til rivalene fra Google og Open AI er det Anthropics egne modeller som ligger nærmest i ytelse.

Den nye modellen skal også utmerke seg innen agentisk verktøybruk, altså evnen til å utføre ulike oppgaver på nettet på egen hånd, samt innen flere av de øvrige ytelsesverktøyene som blant annet dekker generell kunnskap, matematikk og visuelle analyser.

Når det gjelder evnen til å utføre oppgaver på egen hånd, har Claude Sonnet 4.5 ifølge Anthropic oppnådd en suksessrate på 61,4 prosent med OSWorld. Dette er et svært krevende benchmark-verktøy som tester om KI-modeller faktisk kan bruke en datamaskin slik et menneske ville gjort, ved å utføre reelle operativsystemoppgaver fra start til slutt.

Potent nettleserutvidelse

Et resultat på 61,4 prosent gir modellen topplassering på OSWorld-rangeringen, hvor selv mange av de kraftigste modellene kun har oppnådd en suksessrate på rundt 40 prosent. Anthropics egen forgjenger Sonnet 4 nådde 42,2 prosent i denne testen for bare fire måneder siden, så fremgangen har altså vært betydelig.

De kraftig forbedrede agentiske egenskapene til nye Claude Sonnet 4.5 kan brukere dra nytte av i den nye «Claude for Chrome»-utvidelsen til Googles nettleser som Anthropic lanserte tidligere i år.

Dette er altså en nettleserutvidelse til Chrome hvor Claude-modellen kan benytte nettleseren til å utføre mange forskjellige oppgaver på vegne av brukeren. Den er ennå et pilotprosjekt som foreløpig ikke har fått en bred lansering, men i første omgang kun er tilgjengelig for 1000 betrodde brukere av Max-abonnementet.

Utover kode- og agentegenskapene hevder Anthropic også at nye Claude Sonnet 4.5 er selskapets sikreste modell hittil. Utviklerne skal ha lagt ned betydelig innsats i å justere adferden til modellen når det gjelder villedning, «smisking» med brukeren og oppmuntring til vrangforestillinger.

Det gjenstår å se hvor lenge Sonnet 4.5 forblir på tronen innen koding og agentferdigheter, da KI-utviklingen- og konkurransen som kjent går unna i et rasende tempo.

Powered by Labrador CMS