kunstig intelligens
Flere hundre tusen personer stemte: Kåret den beste snakkeroboten
Claude 3 drar forbi GPT-4 på Chatbot Arena.
Den pågående KI-krigen har allerede gitt oss en liten hær av snakkeroboter, eller store språkmodeller som det også kalles.
Denne utviklingen har gjort det mer interessant å rangere de ulike modellene på markedet for å gi folk en idé om hvilke som er de beste. Én slik rangering heter Chatbot Arena, som nå har fått en nykommer på topp.
Blant andre Toms Guide rapporterte om saken.
Basert på menneskelige tilbakemeldinger
Chatbot Arena rangerer en lang rekke ulike snakkeroboter basert på tilbakemeldinger fra personer som bruker robotene, og ikke på de mer kjente, tekniske ytelsesmålingene som MMLU (Massive Multitask Language Understanding) og lignende.
Plattformen er utviklet av LMSYS Org (Large Model Systems Organization), en åpen forskningsorganisasjon etablert av studenter fra flere amerikanske universiteter.
– Tradisjonelle benchmark-målinger som MMLU har vært nyttige, men de kan komme til kort når det gjelder å fange opp nyansene rundt menneskelige preferanser og ekte samtaler hvor utfallet ikke er forhåndsbestemt. Vi tror at det å få tilbakemeldinger fra brukere produserer de meste direkte signalene, skriver organisasjonen om tilnærmingen sin.
Stemmene fra brukere gis på bakgrunn av tester hvor anonymiserte snakkeroboter parvis «kjemper» mot hverandre ved at brukerne gir de samme tekstinstruksene til begge modellene, og deretter velger hvilken som ga det beste resultatet.
Chatbot Arena ble først lansert i mai i fjor og har hittil fått inn over 400.000 stemmer fra brukere.
GPT-4 erstattet av Claude 3
Ikke overraskende er det OpenAI sin ChatGPT-tjeneste, eller nærmere bestemt selskapets mest avanserte modellen GPT-4, som har ligget på topp i lang tid.
Denne ble imidlertid nylig dyttet ned fra tronen og erstattet med Anthropics modell Claude 3 Opus, som Digi.no rapporterte om nylig. Denne modellen får 1253 poeng etter det såkalte Elo-poengsystemet, mens GPT-4 har 1251 poeng.
Forskjellen mellom de to lederne er med andre ord ikke stor. Det er imidlertid et stykke ned til nestemann på listen, Googles Gemini Pro, som får 1203 poeng.
Claude 3 Opus er riktignok Anthropic sin kraftigste modell, men også de andre Claude-modellene innehar høye plasseringer på listen.
Da Claude 3 ble lansert skrøt utvikleren av at den presterte bedre enn samtlige konkurrenter i alle de vanligste målingsverktøyene for KI-systemer. Både i MMLU-målingen og flere andre målingsverktøy for blant annet språk, matematikk, generell kunnskap og koding, gjorde Claude 3 det bedre enn GPT-4, ifølge Anthropic.
Mer informasjon om LMSYS Org kan man finne på prosjektets hjemmeside.