kunstig intelligens
Ny studie rangerer de beste KI-modellene: Dette er vinneren
Den seneste GPT-5-modellen kommer ikke spesielt bra ut i testen.
Chat GPT har inntatt ledelsen på KI-modellmarkedet, men det er likevel bare én av stadig flere rivaler, og heller ikke nødvendigvis den «beste». Nå har det kommet en rangering som kan gi en pekepinn på kvaliteten til de ulike modellene.
Det britiske selskapet Prolific, som spesialiserer seg på datainnsamling for studier innen blant annet teknologi, har utarbeidet et omfattende evalueringsverktøy for KI-modeller døpt «Humaine».
Humaine ble nylig kunngjort i et blogginnlegg på nettstedet Hugging Face (via Tom's Guide), og rangerer til sammen 27 KI-modeller.
Google Gemini på topp
Rangeringen er utarbeidet på bakgrunn av hvordan modellene presterer, basert på naturlig, menneskelig interaksjon. Datagrunnlaget er hentet inn fra over 21.000 deltakere fra 22 ulike, demografiske grupper som evaluerte modellene i en rekke realistiske bruksscenarier – uten å kjenne til modellens identitet.
Deltakerne befinner seg i USA og Storbritannia, men resultatene er trolig også representative for øvrige regioner. Evalueringen er delt inn i fire kategorier: oppgaveløsning/resonnering, kommunikasjonsstil, interaksjonsflyt og tillit/sikkerhet.
Av de 27 modellene som så langt er inkludert i rangeringen, er det Googles Gemini 2.5 Pro som ligger på førsteplassen, når alle testkategoriene er tatt i betraktning.
Kanskje noe overraskende ligger Open AIs GPT-4.1 helt nede på en åttendeplass, og ekstra overraskende er det at den seneste GPT-5-modellen har en enda lavere plassering – nemlig en syttendeplass.
Fra et vanlig forbrukerperspektiv kan det dermed se ut til at folk foretrekker den forrige versjonen av Open AIs modell over GPT-5 – som ble så dårlig mottatt at Open AI ble tvunget til å foreta justeringer.
Europeisk modell på tredjeplass
Bak Gemini 2.5 Pro følger kinesiske Deepseek v3, mens europeiske brukere kan glede seg over at det franske KI-selskapet Mistral har inntatt tredjeplassen på listen med sin Magistral Medium-modell – som allerede har gjort det skarpt i en rekke ytelsesmålinger.
Mistral mottok for øvrig nylig en gigantinvestering fra nederlandske AMSL som gjør selskapet til Europas største KI-aktør målt i markedsverdi.
Bak Magistral Medium finner vi Elon Musks Grok 4 og Grok 3 på henholdsvis tredje- og fjerdeplass, fulgt av Gemini 2.5 Flash og Deepseek R1.
Denne rangeringen er altså basert på samtlige testkategorier sett under ett, og om man tar for seg de individuelle kategoriene ser bildet litt annerledes ut. Google Gemini-modell ligger imidlertid på topp eller nær toppen i samtlige kategorier.
– Dagens evalueringsmetoder bruker hovedsakelig måleparametere som er meningsfulle for forskere, men lite gunstige for hverdagsbrukere, slik som spesialiserte datasett, ytelse innen sære resonneringsoppgaver og så videre. Dette har skapt et skille mellom hva modellene optimaliseres for, og hva folk faktisk verdsetter, skriver Prolific om motivet bak den nye evalueringsmetoden.
Flere detaljer om metodologien finner man i blogginnlegget, og selve rangeringen finner man på denne siden.