kunstig intelligens

Dette er yrkene hvor KI-modellene gjør det like bra eller bedre enn mennesker

Open AI har lansert ny ytelsesmåling.

Open AI har utviklet nytt ytelsesverktøy som tester KI-modellenes evne til å ta seg av realistiske arbeidsoppgaver, og modellene har allerede kommet svært langt.
Open AI har utviklet nytt ytelsesverktøy som tester KI-modellenes evne til å ta seg av realistiske arbeidsoppgaver, og modellene har allerede kommet svært langt.

Etter hvert som KI-modellene raskt blir mer avanserte, har det også blitt stadig viktigere å utvikle ytelsesverktøy til å måle hvor gode modellene faktisk er.

Slike verktøy har imidlertid ofte store begrensninger og fokuserer primært på ytelsen innen spesifikke, avgrensede oppgaver. Dette ønsker Open AI nå rette på, med et helt nytt ytelsesverktøy.

På nettsidene sine har selskapet presentert «GDPval», et verktøy spesifikt designet for å måle hvordan KI-modellene presterer i en realistisk jobbkontekst, sammenlignet med mennesker.

Laget av proffer

Verktøyet tester de fremste KI-modellene på til sammen 1320 spesialiserte, representative oppgaver som er nøye designet og godkjent av erfarne profesjonelle med minst 14 års erfaring fra sine respektive felt.

Disse oppgavene er fordelt på 44 yrker hentet fra ni av de viktigste industriene i USA målt etter andel av brutto nasjonalprodukt. Hver oppgave er basert på realistiske scenarier man vil møte på i utøvelsen av yrkene.

Et utvalg av yrkene omfattet i den nye studien. Programvareutvikling (nederst til høyre) er blant yrkene hvor KI-modellene oftest gjorde det bedre enn menneskelige eksperter. Foto: Open AI
Et utvalg av yrkene omfattet i den nye studien. Programvareutvikling (nederst til høyre) er blant yrkene hvor KI-modellene oftest gjorde det bedre enn menneskelige eksperter.

Det betyr også at oppgavene ikke er basert på rene tekstinstrukser, men involverer en rekke ressurser som dokumenter, multimedia-filer, diagrammer og regneark.

Verktøyet ble brukt til å kjøre blinde evalueringer av hvordan de fremste KI-modellene presterte sammenlignet med menneskelige eksperter. Modellene som ble evaluert var GPT‑4o, o4-mini, OpenAI o3, GPT‑5, Claude Opus 4.1, Gemini 2.5 Pro og Grok 4.

Ytelsen til modellene angis med et prosenttall, hvor 50 prosent betyr at modellen presterer på nivå med en menneskelig ekspert, og over 50 prosent betyr at modellen gjorde det bedre enn mennesker.

Anthropics Claude-modell best

Hovedfunnet i studien var at mange av modellene nå presterer like godt eller bedre enn mennesker i mange oppgaver og yrker.

Kanskje noe overraskende er det Anthropics Claude Opus 4.1 som i snitt skåret høyest av alle modellene i testen når samtlige oppgaver og yrker er tatt i betraktning.

Open AI sier at Claude Opus 4.1 gjorde det spesielt bra innen de mer «estetiske» oppgavene, som formattering av dokumenter og lysbilde-layout. Open AIs egen GPT-5 gjorde det imidlertid skarpt innen presisjon, for eksempel når det gjelder å finne frem til relevant informasjon og følge instrukser.

Når det gjelder spesifikke yrker var det blant annet innen programvareutvikling at modellene – kanskje ikke overraskende – gjorde det skarpest. Fire av de syv KI-modellene skåret mellom 60-70 prosent i testen, som altså betyr at de gjorde det betydelig bedre enn de menneskelige ekspertene.

KI-modellene kan også konkurrere med mennesker innen salg. I salgslederyrker gjorde fire modeller det vesentlig bedre enn menneskene, og GPT-5-modellen fikk for eksempel her et resultat på hele 79 prosent.

Ennå under utvikling

I en rekke andre yrkesgrupper, inkludert ekspeditører/ utleiemedarbeidere, eiendomsmegling, kundeservicemedarbeidere og daglige ledere/driftsledere, ligger KI-modellene omtrent på nivå med – eller litt under – de erfarne, menneskelige arbeiderne.

Noen av yrkene hvor KI-modellene hadde lavest suksessrate var mekaniske og industrielle ingeniører, rekreasjonsrelaterte yrker, lyd/video-teknikere, farmasøyter og finansledere.

Open AI understreker at GDPval-verktøyet ennå er under utvikling, og at resultatene ikke nødvendig bør ses på som en indikasjon på hvilke kobber som står i fare for å bli erstattet av KI.

– Tidlige GDPval-resultater viser at modeller allerede kan ta på seg noen repetitive, godt spesifiserte oppgaver raskere og til lavere kostnad enn eksperter. Imidlertid er de fleste jobber mer enn bare en samling oppgaver som kan skrives ned. GDPval fremhever hvor KI kan håndtere rutineoppgaver slik at folk kan bruke mer tid på de kreative, skjønnsmessige delene av arbeidet, skriver selskapet.

Flere detaljer omkring metodologi og resultater finner man i selve studien.

Powered by Labrador CMS