kunstig intelligens

Stor rapport: KI er nå blitt så avansert at den er vanskelig å måle

Fyldig statusoppdatering når det gjelder kunstig intelligens.

KI-modellene blir mer avanserte i et forrykende tempo, og ytelsesverktøyene henger bare såvidt med.
KI-modellene blir mer avanserte i et forrykende tempo, og ytelsesverktøyene henger bare såvidt med.

Den raske progresjonen på KI- fronten har gjort det vanskelig å danne et godt bilde av akkurat hvor vi befinner oss i utviklingen. Nå har det kommet en ny, omfattende rapport som gir oss nettopp det.

Prestisjeuniversitetet Stanford University publiserte nylig sin seneste «Artificial Intelligence Index Report», som byr på en fyldig statusoppdatering når det gjelder kunstig intelligens.

Techcrunch var blant de som fanget opp saken.

Rapporten er basert på en mangfoldig metodologi som kombinerer verifiserbare data fra kvantitative ytelsesmålinger, data knyttet til forskning, patenter og økonomi, samt samfunnsanalyser. Den er tverrfaglig og involverer en lang rekke partnere.

Ytelsesverktøyene henger etter

Blant de mange hovedfunnene i rapporten er at utviklingen på KI-fronten nå er så rask at teknologiens ytelse er blitt krevende å måle på en troverdig måte – fordi selve målingsverktøyene er i ferd med å bli utdaterte.

– KI-modeller forbedret seg raskt i 2025, med resultater på benchmark-tester som økte på tvers av språk, resonnering, koding og matematikk. Samtidig blir evalueringene forbikjørt av fremgangen de ble laget for å måle, og benchmark-tester møter i økende grad spørsmål om påliteligheten sin, heter det i rapporten.

Forskerne omtaler et fenomen kalt «benchmark-metning», som betyr at mer eller mindre samtlige av de mest avanserte modellene nå oppnår så høye resultater at testene ikke klarer å skille dem fra hverandre på en meningsfull måte.

Dermed har det også oppstått en konvergens i toppen, hvor svært små marginer skiller toppmodellene fra hverandre.

Over 87 prosent i resonneringstest

For eksempel, i begynnelsen av inneværende år oppnådde alle de 15 ledende KI-modellene et resultat på over 87 prosent i MMLU-Pro-målingen – et avansert verktøy som måler resonneringsevner og kunnskap på bakgrunn av 12.000 spørsmål fordelt på 14 domener.

I 2024 lå de beste KI-modellene til sammenligning på mellom 50 og 70 prosent med dette verktøyet, som for øvrig ble lansert som en oppfølger til det allerede utdaterte MMLU-verktøyet.

Et annet kraftig ytelsesverktøy som snart allerede kan bli utdatert er MMMU (Massive Multi-discipline Multimodal Understanding). Dette verktøyet evaluerer multimodal resonnering ved hjelp av spørsmål på universitetsnivå som kombinerer tekst med visuelle elementer som diagrammer, grafer, tabeller og ligninger.

I februar i år skåret den kraftigste modellen, i dette tilfellet Googles Gemini 3.1 Pro, 88,2 prosent med MMMU. Dette er bare 0,4 prosent under nivået til den beste menneskelige eksperten, som representerer referansetallet på 88,6 prosent.

Stor fremgang på HLE-testen

En av de kanskje mest krevende ytelsestestene for KI-modeller heter «Humanity's Last Exam» (HLE) – et multimodalt verktøy som er ment å representere selveste «frontlinjen» av menneskelig kunnskap. Verktøyet ble utviklet nettopp for å møte problemet med utdaterte ytelsesmålinger.

Ifølge Stanford-rapporten oppnådde de kraftigste KI-modellene et presisjonsnivå på kun rundt 10 prosent i HLE-testen på tampen av 2024. Nå har toppmodellene imidlertid klatret helt opp til rett rundt 40 prosent i snitt i den samme testen – en temmelig imponerende fremgang.

HLE har for øvrig blitt et anerkjent verktøy, og ble nylig publisert i det anerkjente vitenskapsmagasinet Nature.

Hele rapporten, som inneholder en lange rekke flere funn, finner man hos Stanford University.

Powered by Labrador CMS