kunstig intelligens

Musks nyeste KI-modell skal ha havnet på topp i test

Milliardæren avduket Grok 4, som skal demonstrere imponerende ferdigheter.

Elon Musks KI-selskap Xai har utviklet verdens kraftigste KI-modell, i alle fall inntil rivalene kommer med sine svar.
Elon Musks KI-selskap Xai har utviklet verdens kraftigste KI-modell, i alle fall inntil rivalene kommer med sine svar.

Det går hett for seg på KI-arenaen, og de ulike aktørene lanserer i tur og orden nye modeller som de gjerne kaller de «beste på markedet». Nå har turen kommet til Elon Musk, som nettopp dro sløret av den seneste Grok-modellen.

I en direktesending på X natt til torsdag viste Musk stolt frem Grok 4, og som seg hør og bør skal også denne slå samtlige konkurrenter – i alle fall inntil videre.

100 ganger mer trening enn Grok 2

– Dette er den smarteste KI-en i verden, og vi skal vise dere akkurat hvordan og hvorfor, åpnet Musk sendingen med.

Grok 4 skal ha fått 100 ganger mer trening enn Grok 2, og benytter naturlig nok mye mer datakraft. Dette skal ha gitt seg utslag i temmelig heftige resultater på de ulike ytelsesmålingene som nå finnes for KI-modeller.

Musk og et knippe andre Xai-ansatte han hadde med seg på scenen brukte ekstra mye tid på den såkalte Humanity's Last Exam-testen (HLE) for å vise frem Grok 4s egenskaper.

HLE-testen er et svært krevende, multimodalt verktøy som er ment å representere «frontlinjen» av menneskelig kunnskap, og en høy poengsum vil altså dermed bety at KI-modellen som testes ligger på nivå med, eller over, menneskelig nivå.

Slik gjorde Grok 4 det i den krevende HLE-testen, med og uten verktøy, sammenlignet med de beste rivalene. Foto: X/Xai
Slik gjorde Grok 4 det i den krevende HLE-testen, med og uten verktøy, sammenlignet med de beste rivalene.

Skal ha havnet på topp

Testen er resultatet av et globalt samarbeid, og består av cirka 2700 vanskelige spørsmål fra nesten 1000 fagspesialister tilknyttet over 500 institusjoner i 50 land – hovedsakelig bestående av professorer, forskere og personer med høyere utdanning.

Mange av de kraftigste KI-modellene på markedet har ikke klart å oppnå de helt store resultatene i HLE-testen, men Grok 4 skal være blant unntakene.

Ifølge Xai selv oppnådde Grok 4 et resultat på 25,4 prosent i HLE-testen uten å benytte tilleggsverktøy, som i så fall er et svært godt resultat. Til sammenligning oppnådde Googles Gemini 2.5 Pro, som for øyeblikket innehar tronen på HLE-topplisten, et resultat på 21,6 prosent. Listen ble senest oppdatert i april i år.

Bak følger Open AIs o3-modell, med et resultat på 20,3 prosent, og deretter o4 mini fra det samme selskapet, med et resultat på 18,1 prosent.

3000 kroner i måneden

Også i den krevende AIME 2025-testen for matematikk, fysikktesten GPQA, og kodetesten LCB skal Grok 4 ha danket ut samtlige av konkurrentene.

Direktesendingen ble for øvrig også benyttet til å avduke «Grok 4 Heavy», en vesentlig kraftigere utgave av Grok 4 som benytter flere KI-agenter som samarbeider for å løse de mest kompliserte problemene – omtrent som en «studiegruppe», i Musks egne ord.

Denne spesialversjonen av Grok 4 oppnådde hele 44,4 prosent i HLE-testen. Den kraftigste rivalen med bruk av tilleggsverktøy, Gemini 2.5 Pro, oppnådde til sammenligning 26,9 prosent.

For å få tilgang til Grok 4 Heavy må man imidlertid punge ut med 300 dollar i måneden, rundt 3000 kroner i måneden, som er prisen på det nye «Supergrok Heavy»-abonnementet. Full Grok 4-tilgang koster, i likhet med Grok 3, 30 dollar i måneden.

Powered by Labrador CMS