kunstig intelligens

Googles nye KI-modell skal være den beste på markedet

Kunngjorde Gemini 2.5, som leder på et par viktige ytelsesmålinger.

Google jobber på spreng for å forbedre Gemini-produktet sitt, og har nettopp sluppet den nyeste versjonen.
Google jobber på spreng for å forbedre Gemini-produktet sitt, og har nettopp sluppet den nyeste versjonen.

KI-kappløpet går unna, og Google jobber hardt for å ta igjen forspranget til Open AI og andre aktører. Nå kan det se ut til at selskapet har inntatt en foreløpig ledelse, med sin splitter nye Gemini-modell.

På nettsidene sine har Google avduket Gemini 2.5, en «tenkende» modell som ifølge dem selv slår konkurrentene i de viktigste ytelsesverktøyene.

Den første utgaven av Gemini 2.5, en eksperimentell versjon av 2.5 Pro, har i skrivende stund klatret til førsteplassen på den såkalte Chatbot Arena-rangeringen med relativt solid margin

Vurderes av brukere

Chatbot Arena rangerer en lang rekke ulike KI-modeller basert på tilbakemeldinger fra personer som bruker modellene, og ikke på de mer kjente, tekniske ytelsesmålingene som MMLU (Massive Multitask Language Understanding) og lignende.

Stemmene fra brukere gis på bakgrunn av tester hvor anonymiserte snakkeroboter parvis «kjemper» mot hverandre ved at brukerne gir de samme tekstinstruksene til begge modellene, og deretter velger hvilken som ga det beste resultatet.

Den eksperimentelle utgaven av Gemini 2.5 Pro har passert blant andre forhåndsutgavene av Grok 3, Open AIs GPT -4.5 og kinesiske Deepdeep R1 på Chatbot Arena – med en poengsum på 1443.

Gemini 2.5 Pro skal også ha gjort det meget godt på Humanity's Last Exam-testen (HLE).

HLE-testen er et svært krevende, multimodalt verktøy som er ment å representere «frontlinjen» av menneskelig kunnskap, og en høy poengsum vil altså dermed bety at KI-modellen som testes ligger på nivå med, eller over, menneskelig nivå.

Gemini 2,5 Pro gjør det skarpt i tester, ikke minst i den krevende HLE-testen, sammenlignet med rivalene. Foto: Google
Gemini 2,5 Pro gjør det skarpt i tester, ikke minst i den krevende HLE-testen, sammenlignet med rivalene.

Prestisjetung test

Testen er resultatet av et globalt samarbeid, og består av cirka 2700 vanskelige spørsmål fra nesten 1000 fagspesialister tilknyttet over 500 institusjoner i 50 land – hovedsakelig bestående av professorer, forskere og personer med høyere utdanning.

Den nye Gemini-modellen oppnådde en suksessrate på på 18,8 prosent. Dette høres kanskje ikke mye ut, men til sammenligning har for eksempel Open AIs nye GPT-4.5 kun oppnådd 6,4 prosent i den samme testen.

Open AIs «tenkende» o3 mini-modell nådde 14 prosent, mens Deepseek R1 fikk et resultat på 8,6 prosent.

Google har imidlertid ikke inkludert Open AIs forskningsorienterte «Deep Research»-modell, som er basert på o3-modellen, på listen sin. Denne modellen oppnådde et resultat på hele 26,6 prosent i HLE-testen, ifølge Open AI.

Gemini 2.5 Pro skal også har gjort det bedre enn de fleste konkurrentene i matematikktestene AIME 2024 og AIME 2025, som bruker matematikkoppgaver fra den prestisjetunge American Invitational Mathematics Examination-konkurransen i USA.

Ting endrer seg raskt på KI-feltet, så det gjenstår å se hvor lenge Google beholder pallplasseringene sine.

Powered by Labrador CMS