kunstig intelligens

Dette er Open AIs aller smarteste modell så langt – skal gi Chat GPT «superkrefter»

Avduket OpenAI 03 og OpenAI 04 mini.

Et knippe Open AI-medarbeidere viser frem o3 og o4 mini, de kraftigste modellene selskapet har lansert hittil.
Et knippe Open AI-medarbeidere viser frem o3 og o4 mini, de kraftigste modellene selskapet har lansert hittil.

KI-kappløpet går unna i et forrykende tempo, og bare dager etter at Open AI lanserte sin nye GPT-4.1-modell, har selskapet nå avduket enda to nye modeller.

Denne gangen er begivenheten imidlertid mer nevneverdig enn før, da de nye modellene er de aller smarteste og kraftigste KI-modellene som selskapet hittil har bygget.

OpenAI o3 er navnet på resonneringsmodellen som selskapet først ga en forsmak på allerede i desember i fjor, og som nå omsider lanseres for offentligheten. Den andre heter OpenAI o4 og er en mindre modell som er optimalisert for hurtighet og kostnadseffektivitet.

Kan bruke alle Chat GPT-verktøyene

Begge er altså tilgjengelige via Chat GPT-tjenesten, som ifølge Open AI vil få et merkbart løft i ytelse og ferdigheter med de nye modellene under panseret. Selskapet lover at modellen også vil legge til rette for enda mer naturlige samtaler med Chat GPT.

For første gang er de nye modellene dessuten i stand til å benytte samtlige av verktøyene inni Chat GPT-tjenesten, som inkluderer nettsøk, analysering av opplastede filer og andre data, og dyp resonnering rundt visuelle input.

Modellene er også spesifikt trent til å finne ut på egen hånd når og hvordan de bruker de ulike verktøyene til å komponere svar og løsninger. Dette skal gjøre Chat GPT mer «agentisk», sier Open AI, noe som altså innebærer at tjenesten vil kunne utføre arbeid på vegne av brukeren på en mer selvstendig måte enn før.

Når det gjelder selve ferdighetene sier Open AI at o3-modellen setter en ny standard i en rekke viktige ytelsesmålinger. Den skal i tillegg være særs sterk innen visuelle oppgaver, som å analysere bilder, grafer og grafiske fremstillinger.

Toppresultat i HLE-testen

En av de mest interessante og krevende ytelsesmålingene for KI-modeller heter «Humanity’s Last Exam» (HLE), et multimodalt verktøy som er ment å representere selveste «frontlinjen» av menneskelig kunnskap. En høy poengsum vil altså dermed bety at KI-modellen som testes, ligger på nivå med eller over menneskelig nivå.

I denne testen oppnådde o3-modellen et presisjonsnivå på 24,9 prosent med tilgang til verktøy og 20,3 prosent uten verktøy.

Dette plasserer modellen på toppen av HLE-rangeringen, så vidt foran Googles Gemini 2.5 Pro, den sterkeste konkurrenten, og relativt langt foran øvrige rivaler som Deepseek R1, Claude 3.7 Sonnet og ikke minst Open AIs egen forgjenger til o3 – nemlig o1-modellen.

Den mindre OpenAI o4-modellen oppnådde respektable 18 prosent i den samme testen, som holder til tredjeplassen på HLE-rangeringen.

Ekspert på koding

Også innen koding er modellene svært gode. o3-modellen oppnådde et resultat på hele 69,1 prosent i SWE-Bench Verified-testen, en test som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github.

Dette resultatet plasserer i så fall o3-modellen på toppen av også SWE-Bench Verified-rangeringen, selv om modellen i skrivende stund ikke er med på listen. En av de kraftigste konkurrentene her er Anthropics Claude 3.7 Sonnet, som til sammenlignet skåret 63,2 prosent.

Modellene ligger også i toppsjiktet når det gjelder generell kunnskap, matematikk og evne til å følge instrukser. Alle detaljene rundt ytelsesresultater finner man i Open AIs egen omtale av de nye modellene.

o3 og o4 mini er tilgjengelige nå for ChatGPT Plus-, Pro- og Team-brukere i modellvelgeren i Chat GPT.

Powered by Labrador CMS