kunstig intelligens

Open AIs nye KI-modell knuste alle andre modeller i ekstremt krevende test

Avduket «Deep Research»-agenten.

Open AI-sjef Sam Altman under et arrangement for å promotere KI for bedrifter i Tokyo.
Open AI-sjef Sam Altman under et arrangement for å promotere KI for bedrifter i Tokyo.

Open AI er trolig den mest omtalte aktøren innen kunstig intelligens, og har har etablert et solid fotfeste med sin Chat GPT-tjeneste. Nå har den populære tjenesten blitt utvidet nok en gang med nye verktøy.

På søndag avduket selskapet noe de kaller «Deep Research», som er en ny, potent KI-agent som er integrert i Chat GPT-tjenesten.

– På nivå med forskningsanalytiker

Deep Research, som navnet antyder, er designet for å gjennomføre ekstra tunge, nettrelaterte oppgaver helt på egen hånd.

– Deep Research er Open AIs neste agent som kan jobbe selvstendig for deg – du gir den en prompt, og Chat GPT vil finne, analysere og syntetisere hundrevis av nettkilder for å lage en omfattende rapport på nivå med en forskningsanalytiker, skriver selskapet i sin egen omtale av nyheten.

Tanken er altså at brukeren kan spare store mengder tid på å gi oppgaver som krever omfattende nettsurfing- og research, til KI-agenten. Open AI skriver at man kan regne med at agenten vil bruke mellom 5 og 30 minutter på å gjennomføre en oppgave, avhengig av arbeidsmengde.

Den nye agenten retter seg mot folk jobber i for eksempel finans, vitenskap og politikk, og som har behov for omfattende, pålitelig forskningsarbeid.

Imidlertid kan den ifølge Open AI også være meget nyttig for vanlige forbrukere, for eksempel seriøse shoppere som har svært spesifikke preferanser eller eksotisk smak.

Basert på Open AI o3

Alle resultatene leveres fullt dokumenterte, med tydelige sitater og oppsummeringer av prosessen bak forskningsarbeidet. Open AI sier agenten er ekstra effektiv når det gjelder å finne niche-informasjon som vanligvis vil kreve at man surfer flere ulike nettsider.

Deep Research-agenten drives av en spesialdesignet versjon av den kraftige resonneringsmodellen OpenAI o3, som selskapet introduserte i desember, og som er den kraftigste de har lansert hittil. Den spesialdesignede utgaven er optimalisert for nettsurfing og dataanalyse, sier Open AI.

Modellen benytter resonneringsferdighetene sine til å søke, tolke og analysere store mengder tekst, bilder, PDF-filer og annet innhold på internett, og tilpasser fremgangsmåten basert på informasjonen den finner.

Deep Research skal ha knust samtlige av de øvrige KI-modellene i den krevende HLE-testen. Foto: Open AI
Deep Research skal ha knust samtlige av de øvrige KI-modellene i den krevende HLE-testen.

Gjorde det bra i svært krevende test

Den nye modellen har som seg hør og bør blitt kjørt gjennom ulike tester, hvor den har gjort det skarpt. Det mest oppsiktsvekkende resultatet var fra et nytt og ekstremt krevende verktøy for ytelsesmåling døpt «Humanity's Last Exam» (HLE).

HLE-testen er et multimodalt verktøy som er ment å representere selveste «frontlinjen» av menneskelig kunnskap, og en høy poengsum vil altså dermed bety at KI-modellen som testes ligger på nivå med, eller over, menneskelig nivå. Datasettet til testen består av 3000 utfordrende spørsmål som dekker over 100 temaer.

I HLE-testen oppnådde Deep Research-modellen en suksessrate på 26,6 prosent. Dette høres kanskje ikke mye ut, men til sammenligning har for eksempel GPT-4o-modellen kun oppnådd 3,3 prosent i den samme testen.

Elon Musks Grok-2 oppnådde 3,8 prosent, Anthropics kraftigste modell Claude 3.5 Sonnet oppnådde 4,3 prosent, mens Googles Gemini Thinking kan skilte med et resultat på 7,7 prosent. Den mye omtalte kinesiske modellen Deepseek R1 er også inkludert, og nådde 9,4 prosent.

Deep Research er for øyeblikket kun tilgjengelig for Pro-brukere, som får opptil 100 spørsmål per måned, og Plus- og Teams-brukere får tilgang senere. Open AI sier de jobber med å gjøre modellen tilgjengelig i EØS-området, som altså innebærer at nordmenn trolig må vente litt lenger.

Powered by Labrador CMS