kunstig intelligens
Grok 3: Så mye bedre skal modellen være sammenlignet med rivalene
Skal ha fått 10 ganger mer trening enn forgjengeren.
Konkurransen innen kunstig har blitt svært intens, og Elon Musk er blant de som ikke akter å sitte på sidelinjen i det økende jaget etter å oppnå best mulig ytelse.
For ikke lenge siden delte Musk nyheten om at XAIs seneste KI-modell Grok 3 var rett rundt hjørnet. I en direktesending på X nylig ble modellen offisielt avduket av Musk selv og et knippe av ingeniørene som har jobbet med teknologien.
Gjør det skarpt i ytelsesmålinger
XAI har allerede gått djervt ut og kaller modellen simpelthen «verdens smarteste KI», noe de i direktesendingen forsøker å underbygge med resultatene fra et knippe viktige ytelsestester.
Under sendingen viste XAI frem en oversikt over hvordan Grok 3 gjorde det i ytelsesmålinger beregnet på resonnering innen matematikk, vitenskap og programmering/koding, sammenlignet med de største konkurrentene – og tilsynelatende gjør Grok 3 det vesentlig bedre enn samtlige.
I AIME 24-målingen, som bruker matematikkoppgaver fra den prestisjetunge American Invitational Mathematics Examination-konkurransen i USA, nådde Grok 3 et resultat på 52 prosent.
Den kraftigste konkurrenten var Deepseek V3, som nådde 39 prosent, og etter følger Googles Gemini 2-Pro med 36 prosent. Claude 3.5 Sonnet og Open AIs GPT-4o ligger et godt stykke bak, med henholdsvis 16 og 9 prosent.
I en ytelsesmåling for vitenskap, basert på spørsmål innen fysikk, biologi og kjemi på doktorgradsnivå, skåret Grok 3 hele 75 prosent, mens samtlige av konkurrentene ligger mellom 50–65 prosent.
Også gode resultater for resonneringsversjonen
I ytelsesverktøyet for koding, Live Code Bench, oppnådde Grok 3 et resultat på 57 prosent. Konkurrentene befinner seg til sammenligning i området 34–40 prosent, så også her er Grok 3 tilsynelatende et hestehode foran.
Live Code Bench er en avansert ytelsesmåling som kontinuerlig samler inn nye oppgaver fra en rekke konkurranseprogrammeringsplattformer, og i tillegg til kodegenerering vurderer verktøyet en rekke kode-relaterte evner, inkludert selvreparasjon, kodekjøring og prediksjon av testresultater.
Disse resultatene gjelder for den «vanlige betaversjonen av Grok 3. XAI viste også frem en oversikt over resultatene til «resonneringsversjonen» av Grok 3, og også her skal modellen ha slått konkurrentene i samtlige av de ovennevnte ytelsestestene – ofte med solid margin.
For eksempel oppnådde den «tenkende» versjonen av Grok 3 et resultat på hele 96 prosent i AIME 24-målingen.
Open AIs kraftige resonneringsmodell o3 mini har til sammenligning oppnådd 87 prosent i den samme testen. Deepseeks resonneringsmodell R1, som til og med Open AI-sjefen kalte «imponerende», nådde 80 prosent i denne testen.
Har doblet datasenter-kapasiteten
I ytelsesverktøyet for koding, Live Code Bench, oppnådde Grok 3 et resultat på 80 prosent. Til sammenligning havnet Open AI o3 mini på 74 prosent, mens Deepseek R1 nådde bare 65 prosent i denne testen.
I presentasjonsvideoen understreker Musk at Grok 3 fremdeles er i en tidlig beta-fase og ennå under trening, og planen er å kontinuerlig forbedre modellen i raskt tempo.
Det er allerede kjent at XAI har bygget sin egen infrastruktur til å kjøre KI-modellene sine på, og under Grok 3-presentasjonen kunne Musk og kompani meddele at datasenteret deres – som i første omgang bestod av 100.000 av Nvidias H100-prosessorer – siden har blitt doblet til 200.000 prosessorer.
Med andre er det tydelig at Elon Musk og resten av XAI har digre ambisjoner på KI-feltet, som allerede er befolket av flere sterke aktører.