kunstig intelligens
Anthropics nye KI-modell skal være den beste på markedet til å utføre PC-oppgaver på egen hånd
Avduket Claude Sonnet 4.6.
Nye KI-modeller lanseres i raskt, og nærmest økende, tempo. Nå har en av de store aktørene, Anthropic, dratt sløret av sin seneste kreasjon – nemlig Claude Sonnet 4.6.
Anthropic opplyser at Claude Sonnet 4.6 er den nye standardmodellen for gratis- og Pro-brukere av Claude-tjenesten, og har som ventet fått en rekke oppgraderinger – faktisk så mange at den nærmer seg Opus-modellen, den kraftigste som tilbys av Anthropic.
Et av områdene hvor Sonnet 4.6 skal utmerke seg, er innen bruk av PC (computer use), hvor modellen nå har klatret opp til toppsegmentet.
Gjør det skarpt i ytelsestester
– Tidlige brukere av Sonnet 4.6 opplever kapasitet på menneskelig nivå i oppgaver som å navigere komplekse regneark eller fylle ut nettskjemaer med flere trinn, før den syr alt sammen på tvers av flere nettleserfaner, skriver selskapet i sin omtale.
I det mest brukte ytelsesverktøyet for PC-bruk, OSWorld, har Sonnet 4.6 en suksessrate på 72,5 prosent, hevder Anthropic. I så fall inntar modellen førsteplassen på OSWorld-rangeringen, foran selskapets forgjenger Sonnet 4.5, som i skrivende stund skilter med 62,9 prosent.
OSWorld er altså et verktøy som måler hvor godt en KI-modell kan bruke applikasjoner og verktøy på samme måte som mennesker. Selve testen består av 369 dataoppgaver som involverer ekte nett- og skrivebordsprogrammer innen åpne domener, fil-håndtering i operativsystemet, og arbeidsflyter som går på tvers av flere applikasjoner.
Til sammenligning har for eksempel Open AIs Computer-Using Agent (CUA), som ble lansert for et drøyt år siden, en suksessrate på kun 31 prosent hos OSWorld, og Chat GPT 5.2 har oppnådd 38 prosent ifølge Anthropics tall.
Siden den gang har Open AI imidlertid lansert den kraftigere Chat GPT Agent-løsningen, men denne har tilsynelatende ikke blitt offisielt testet med OSWorld ennå.
Foretrekkes av bedrifter
I tillegg skal nye Claude Sonnet 4.6 ha gjort det ekstra skarpt med ytelsesverktøyet GDPval-AA (General Digital Performance evaluation – Autonomous Agents), et annet viktig verktøy for måling av agentisk/autonom oppgaveutførelse.
Her har modellen inntatt førsteplassen med en ELO-poengsum på 1633, et lite hestehode foran Anthropics flaggskipmodell Claude Opus 4.6, og et større hestehode foran Open AIs Chat GPT 5.2 – som ligger inne med en poengsum på 1462. Googles Gemini 3 Pro har 1201 poeng.
GDPval-AA måler i korte trekk hvor godt en autonom KI-agent klarer å gjennomføre komplette, målrettede digitale oppgaver uten tett menneskelig styring – herunder planlegging og utførelse av flerstegsoppgaver og bruk av verktøy som nettleser, API-er, kode og filer.
Anthropic ligger ennå et stykke bak Chat GPT og Gemini når det gjelder brukertall, men selskapet har gjort store fremskritt den siste tiden, og Claude-teknologien er særlig populær på bedriftsmarkedet.
Ifølge beregninger fra investeringsselskapet Menlo Ventures, har Anthropic nå kapret rundt 40 prosent av bedriftsmarkedet innen KI-modeller, opp fra 24 prosent i 2024 og kun 12 prosent i 2023.