kunstig intelligens

Open AI har lansert sin kraftigste KI-modell hittil – tar stort steg mot AGI

Avduket nylig «OpenAI o3».

Mark Chen (t.v.) og Sam Altman i Open AI demonstrerer evnene til den nye o3-modellen, som tar et viktig skritt mot kunstig, generell intelligens (AGI).
Mark Chen (t.v.) og Sam Altman i Open AI demonstrerer evnene til den nye o3-modellen, som tar et viktig skritt mot kunstig, generell intelligens (AGI).

På den siste dagen av sitt 12-dagers lanseringsarrangement «12 Days of OpenAI» avduket selskapet i en video det som trolig er den største nyheten – nemlig det seneste innslaget i selskapets «eliteserie» av KI-modeller.

OpenAI o3 er navnet på oppfølgeren til den «tenkende» o1-modellen som selskapet lanserte tidligere i år, og som allerede har demonstrert imponerende egenskaper. Open AI valgte å hoppe over o2-navnet.

Meget god på matematikk og vitenskap

I kunngjøringsvideoen opplyser Open AI-sjef Sam Altman at o3-modellen, som også lanseres i en mer kostnadseffektiv «mini»-versjon, ikke vil bli lansert for offentligheten i denne omgang. Den skal blant annet gjennom grundige sikkerhetstester før det kan skje.

Under presentasjonen av den nye o3-modellen forteller Open AI at den blant annet gjør det meget sterkt innen matematikk og programmering.

Modellen skal ha oppnådd et presisjonsnivå på hele 96,7 prosent i en ytelsestest basert på AIME 2024 (American Invitational Mathematics Examination), som er en prestisjetung matematikkonkurranse i USA. Til sammenligning oppnådde forgjengeren o1 kun 83,3 prosent.

Modellen ble også testet med et ytelsesmål kalt GPQA Diamond, som tester kunnskap innen vitenskap med spørsmål som er utformet av eksperter innen biologi, fysikk og kjemi. Her skåret 03-modellen 87,7 prosent, mot forgjengerens 78 prosent.

For å sette dette i perspektiv: En menneskelig ekspert med doktorgrad vil på sitt felt i snitt skåre rundt 70 prosent på denne testen, ifølge Open AI.

Den nye o3-modellen satte ny rekord med Arc-AGI-verktøyet, som er designet for å måle progresjon mot AGI. Foto: OpenAI/YouTube
Den nye o3-modellen satte ny rekord med Arc-AGI-verktøyet, som er designet for å måle progresjon mot AGI.

Nærmer seg AGI

Det er imidlertid innen koding at den nye o3-modellen virkelig skinner, skal vi tro resultatene. Open AI kjørte modellen gjennom den såkalte SWE-bench-testen, en krevende ytelsestest som brukes til å måle KI-modellers evne til å løse problemer i virkelige kodeprosjekter på Github.

I denne testen endte modellen opp med et resultat på 71,7 prosent, som er hele 22 prosent høyere enn forgjengeren o1. Altman selv bruker ordet «utrolig» i sin beskrivelse av resultatet.

Open AI hadde imidlertid ett ytelsesmål til i ermet under presentasjonen, som kanskje er det mest interessante.

«Arc AGI» er navnet på et ytelsesverktøy som er designet for å evaluere KI-systemers evne til å generalisere og resonnere på en måte som ligner menneskelig intelligens – altså det som gjerne omtales som AGI, kunstig, generell intelligens.

Et system som er i stand til å løse oppgavene som dette verktøyet opererer med, regnes for å ha tatt et stort skritt mot AGI. De siste fem årene har ingen KI-systemer klart å løse oppgavene.

Mye arbeid gjenstår ennå

Den nye o3-modellen klarte riktignok heller ikke å løse alle oppgavene, men den satte en ny rekord – som i seg selv omtales som en stor bragd.

o3-modellen endte med et resultat på 75,7 prosent, der forgjengeren lå helt nede på litt over 30 prosent. Dette resultatet ble oppnådd med såkalt «low compute». Da modellen ble kjørt på kraftigere maskinvare, «high compute» på originalspråket, endte resultatet på hele 87,5 prosent.

Et menneskelig nivå tilsvarer rundt 85 prosent i denne testen, og dermed snakker vi om en betydelig milepæl.

Som Open AI poengterer, er det imidlertid mye arbeid som gjenstår, og en viktig del av arbeidet fremover er å utvikle nye og bedre ytelsesverktøy til å guide arbeidet mot AGI og veien videre. Akkurat når den nye o3-modellen blir tilgjengelig for offentligheten, er uvisst.

Powered by Labrador CMS