kunstig intelligens

Anthropic slipper ny KI-modell

Anthropic lanserer Claude 3.7 Sonnet.

Anthropics Claude-modeller blir stadig mer avanserte og hevder seg i konkurransen mot rivalene, særlig innen koding.
Anthropics Claude-modeller blir stadig mer avanserte og hevder seg i konkurransen mot rivalene, særlig innen koding.

En av Open AIs amerikanske hovedkonkurrenter heter Anthropic, grunnlagt av et knippe tidligere Open AI-ansatte. Selskapets Chat GPT-rival heter Claude, og nå har denne familien fått et nytt medlem.

På nettsidene sine har Anthropic nå avduket sin kraftigste modell hittil – Claude 3.7 Sonnet – og med denne har selskapet forsøkt seg på en ny vri.

Claude 3.7 Sonnet er nemlig en såkalt hybridmodell, noe som skal gjøre den til den første i sitt slag på markedet. Hybrid-tilnærmingen innebærer at modellen er både en vanlig språkmodell (LLM) og en resonneringsmodell på samme tid.

Optimalisert for realistiske oppgaver

Anthropic og selskapets president Daniela Amodei trapper opp konkurransen mot språkmodell-rivalene. Foto: Steve Marcus/Reuters/NTB
Anthropic og selskapets president Daniela Amodei trapper opp konkurransen mot språkmodell-rivalene.

– På samme måte som mennesker bruker én hjerne både for raske responser og dyp refleksjon, mener vi at resonnering bør være en integrert evne i avanserte modeller i stedet for å være et helt separat system, skriver Anthropic om filosofien bak modellen.

I praksis betyr dette at brukere kan velge når man ønsker at modellen skal svare på normalt vis, og når man ønsker at den skal tenke lengre og dypere før den svarer. I sistnevnte tilfelle kan brukere også se selve resonneringsprosessen.

I standardmodus er modellen en oppgradert versjon av forgjengeren Claude 3.5 Sonnet, sier Anthropic, mens i «tenkemodusen» er modellen selvreflekterende og i stand til vesentlig høyere ytelse innen for eksempel matematikk, fysikk, det å følge instrukser og mange andre oppgaver.

Anthropic skriver at resonneringsdelen til nye Claude 3.7 Sonnet er noe mindre optimalisert for blant annet matematikkoppgaver. I stedet har man valgt å optimalisere modellen for oppgaver som er mer realistiske og «matnyttige» for brukere og bedrifter.

Denne prioriteringen har først og fremst gitt utslag innen koding, hvor den nye modellen skal gjøre det meget skarpt sammenlignet med konkurrentene.

Anthropic kjørte modellen gjennom den såkalte SWE-bench-testen, en krevende ytelsestest som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github.

Claude 3.7 Sonnet ligger tilsynelatende et solid hakk foran konkurrentene når det gjelder koding. Illustrasjon: Anthropic
Claude 3.7 Sonnet ligger tilsynelatende et solid hakk foran konkurrentene når det gjelder koding.

Utmerker seg innen agent-bruk

I denne testen oppnådde Claude 3.7 Sonnet et presisjonsnivå på 62,3 prosent. Dette er et hestehode foran konkurrentene OpenAI o1, OpenAI 03-mini og Deepseek R1, som alle har skåret rundt 49 prosent i den samme testen.

Det skal nevnes at Open AIs kraftigste modell, den nylig avdukede Open AI o3-modellen, skåret hele 71,7 prosent i SWE-bench-testen. Den er imidlertid ennå ikke lansert på markedet.

Det andre området hvor Claude 3.7 Sonnet utmerker seg, er innen bruk av selvstendige KI-agenter. I den forbindelse ble modellen testet med det såkalte TAU-bench-verktøyet (Tool-Agent-User), som måler effektiviteten og kvaliteten i komplekse interaksjoner mellom KI-agenten, verktøyene og brukeren i reelle scenarier.

I denne målingen fikk Claude 3.7 Sonnet et resultat på 81,2 prosent i et handelsscenario (retail), der Open AIs o1 fikk 73,5 prosent. De øvrige konkurrentene var ikke inkludert i denne sammenligningen.

Når det gjelder agenter, kunngjorde Anthropic for øvrig også en annen stor nyhet: Claude Code. Dette er en KI-agent beregnet på nettopp koding, og den beskrives av selskapet som en samarbeidspartner som kan søke og lese kode, redigere filer, skrive og kjøre tester, laste opp kode til GitHub og bruke kommandolinjeverktøy – og holde deg oppdatert om hvert steg.

Claude 3.7 Sonnet er tilgjengelig i samtlige av Anthropics abonnementsalternativer. Flere detaljer finner man på nettsidene.

Powered by Labrador CMS