kunstig intelligens

Anthropics nye KI-modeller fullførte på én dag det et helt team brukte to måneder på

Utmerker seg på flere felt, men er ikke uten farer.

Anthropic, her ved sjef Dario Amodei, lanserer stadig modeller som hever øyenbryn.
Anthropic, her ved sjef Dario Amodei, lanserer stadig modeller som hever øyenbryn.

Anthropic lanserte nylig sine nyeste KI-modeller, og med tanke på hvor mye rabalder selskapet allerede har laget med sin Mythos Preview-modell, lå det i kortene at de nye modellene også ville bli muskuløse saker.

Som seg hør og bør med nye KI-modeller, har Anthropic kjørt de nye Fable 5- og Mythos 5-modellene gjennom alle mulige ytelsestester – hvor de tilsynelatende danker ut all konkurranse, i alle fall for øyeblikket.

Særlig innen koding gjør modellene det svært skarpt. Med det krevende benchmark-verktøyet Swe-bench Pro skårer Fable 5/Mythos 5 hele 80,3 prosent, som er høyere enn selskapets mye omtalte Mythos Preview-modell.

To måneders arbeid på én dag

Det er også langt høyere enn den nærmeste konkurrenten GPT-5.5, som har oppnådd kun 58,6 prosent i den samme testen.

Swe-bench Pro er for ordens skyld et verktøy som tester om KI kan løse ekte feil og oppgaver fra faktiske programvareprosjekter på GitHub – altså ikke konstruerte testoppgaver, men reelle problemer innsendt av utviklere. Det regnes som den mest troverdige kodingstesten fordi den måler faktiske arbeidsresultater.

Kodeferdighetene ser også ut til å ha blitt bekreftet under reelle omstendigheter, av en av Anthropics partnere, Stripe. Dette er et amerikansk betalingsselskap som håndterer nettbetalinger for millioner av bedrifter globalt, og som er kjent for å ha en av verdens mest komplekse kodebaser.

– Under tidlig testing rapporterte Stripe at Fable 5 komprimerte måneder med utviklingsarbeid til dager. I en Ruby-kodebase på 50 millioner linjer gjennomførte modellen en migrering på tvers av hele kodebasen på én dag – en oppgave som ellers ville ha tatt et helt team over to måneder å utføre manuelt, skriver Anthropic.

Overgikk eksperter på legemiddeldesign

En annen nevneverdig bragd Mythos 5 stod bak, ifølge KI-giganten, var legemiddeldesign. KI-giganten hevder at modellen hjalp interne eksperter på proteindesign med å øke hastigheten på deler av legemiddelutviklingsprosessen med omtrent en faktor på ti.

I ett eksempel fant de at Mythos 5, utstyrt med verktøy for proteindesign og bioinformatikk, men uten menneskelig assistanse, matchet eller overgikk dyktige, menneskelige eksperter. Modellen skal ha utført alle oppgavene som normalt håndteres av en forsker; å velge bindingssteder, velge og kjøre verktøy for proteindesign, samt håndtere og komme seg videre etter feil underveis.

Hele ni av de 14 proteinmålene i studien skal ha resultert i sterke kandidater for legemiddelutvikling, som selskapet nå undersøker videre.

Mythos 5 og Fable 5 har for ordens skyld mer eller mindre de samme ferdighetene, men med den forskjellen at Mythos 5 har færre sikkerhetssssystemer på plass og er derfor kun tilgjengelig for et utvalg Project Glasswing-partnere.

Ikke uten farer

Dette bringer også med seg visse farer som Anthropic er åpne på. I «systemkortet», som detaljert beskriver resultatene av sikkerhetstester av modellene, peker selskapet blant annet på at modellene har såkalte «CB-1»-kapasiteter. Det innebærer blant annet at de potensielt kan syntetisere ikke-nye kjemiske og biologiske våpen.

Ifølge Anthropic krysser modellene ikke terskelen for kapasitetene som trengs for utvikling av nye våpen, men selskapet understreker at dette er langt mindre sikkert enn for tidligere modeller.

– Vi mener at Mythos 5 uten sikkerhetstiltak kan gi betydelig kapasitetsøkning til trusselaktører med gode ressurser, skriver Anthropic.

Selskapet har opparbeidet seg et visst rykte for å være ærlige på risikoen knyttet til avansert KI, og har flere ganger bedt amerikanske myndigheter om å ta KI-regulering på alvor.

Powered by Labrador CMS