kunstig intelligens
Anthropic hevder de har lansert verdens beste KI-modell til to viktige oppgaver
Anthropic sparer ikke på superlativene med sin seneste modell.
En av de mest fremadstormende rivalene til Open AI og Google på KI-arenaen er Anthropic, som har satt seg på kartet med sine høyst kompetente Claude-modeller. Nå har selskapet dratt sløret av sin seneste nykommer, og den skal være ganske så muskuløs.
Anthropic kaster all beskjedenhet til side og kaller simpelthen sin nye Claude Sonnet 4.5-modell for verdens beste modell til både koding og til å bruke en datamaskin på egen hånd – det som gjerne kalles «agentiske» egenskaper.
Topplassering innen koding
De djerve påstandene underbygges blant annet av resultatene som Claude Sonnet 4.5 har oppnådd i det mye brukte benchmark-verktøyet SWE-bench Verified.
SWE-bench er en krevende ytelsestest som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github, og «Verified»-versjonen av verktøyet er en enda grundigere utgave av testen som opererer med høyere kvalitetsstandarder.
I denne testen skal Claude Sonnet 4.5 ha oppnådd et presisjonsnivå på 77,2 prosent. Dette er et lite hestehode foran konkurrenten Open AI sin GPT-5 Codex (74,5 prosent) og et større hestehode foran Googles Gemini 2.5 Pro (67,2 prosent).
Den nye modellen skal også utmerke seg innen agentisk verktøybruk, altså evnen til å utføre ulike oppgaver på nettet på egen hånd, samt innen flere av de øvrige ytelsesverktøyene som blant annet dekker generell kunnskap, matematikk og visuelle analyser.
Når det gjelder evnen til å utføre oppgaver på egen hånd, har Claude Sonnet 4.5 ifølge Anthropic oppnådd en suksessrate på 61,4 prosent med OSWorld. Dette er et svært krevende benchmark-verktøy som tester om KI-modeller faktisk kan bruke en datamaskin slik et menneske ville gjort, ved å utføre reelle operativsystemoppgaver fra start til slutt.
Potent nettleserutvidelse
Et resultat på 61,4 prosent gir modellen topplassering på OSWorld-rangeringen, hvor selv mange av de kraftigste modellene kun har oppnådd en suksessrate på rundt 40 prosent. Anthropics egen forgjenger Sonnet 4 nådde 42,2 prosent i denne testen for bare fire måneder siden, så fremgangen har altså vært betydelig.
De kraftig forbedrede agentiske egenskapene til nye Claude Sonnet 4.5 kan brukere dra nytte av i den nye «Claude for Chrome»-utvidelsen til Googles nettleser som Anthropic lanserte tidligere i år.
Dette er altså en nettleserutvidelse til Chrome hvor Claude-modellen kan benytte nettleseren til å utføre mange forskjellige oppgaver på vegne av brukeren. Den er ennå et pilotprosjekt som foreløpig ikke har fått en bred lansering, men i første omgang kun er tilgjengelig for 1000 betrodde brukere av Max-abonnementet.
Utover kode- og agentegenskapene hevder Anthropic også at nye Claude Sonnet 4.5 er selskapets sikreste modell hittil. Utviklerne skal ha lagt ned betydelig innsats i å justere adferden til modellen når det gjelder villedning, «smisking» med brukeren og oppmuntring til vrangforestillinger.
Det gjenstår å se hvor lenge Sonnet 4.5 forblir på tronen innen koding og agentferdigheter, da KI-utviklingen- og konkurransen som kjent går unna i et rasende tempo.