kunstig intelligens
Studie avslører svakheter i KI-modellenes kodeferdigheter
Forskere laget nytt ytelsesverktøy som avslører betydelige svakheter.
Vi lever i KI-modellenes æra, og et av områdene hvor modellene virkelig har funnet sin plass, er innen koding – hvor de fleste kan vise til relativt solide evner. Nå sås det imidlertid tvil om hvor gode KI-modellene faktisk er, når man sammenligner med menneskelige eksperter.
En gjeng forskere fra flere universiteter, deriblant Princeton University og New York University i USA, gjennomførte nylig et eksperiment som innebar å teste KI-modellenes kodeevner med et nytt og kraftig forbedret ytelsesverktøy – med skuffende resultater.
Arbeidet ble publisert tidligere denne måneden hos nettstedet Hugging Face.
Store mangler
Hovedtesen til forskerne er at KI-modellene ikke er så gode i koding som mange tror, fordi eksisterende benchmark-verktøy som måler ytelsen til modellene, har store, innebygde svakheter.
Forskerne hevder at dagens KI-modeller ofte lykkes ved å gjenkjenne mønstre i implementasjon og ved å benytte eksterne verktøy, snarere enn å løse problemer på en forståelsesbasert måte.
– Selv om det hevdes at store språkmodeller nå matcher eller overgår eliten i konkurranseprogrammering, er disse påstandene misvisende fordi eksisterende målemetoder ikke tester reell algoritmisk resonnering, skriver forskerne.
På bakgrunn av dette utviklet forskerne et nytt benchmark-verktøy døpt «Live Code Bench Pro», som altså skal være en kraftig forbedret utgave av Live Code Bench – et av de mest utbredte verktøyene for måling av kodeferdigheter for KI-modeller.
Live Code Bench Pro er et verktøy bestående av kodeproblemer fra blant annet Codeforces – en plattform for konkurranseprogrammering på høyt nivå som inneholder et stort antall algoritmiske kodeproblemer.
Løste ikke de vanskelige oppgavene
I tillegg inneholder verktøyet kodeproblemer fra de to programmeringskonkurransene ICPC (International Collegiate Programming Contest) og IOI (International Olympiad in Informatics).
Oppgavene oppdateres kontinuerlig for å redusere risikoen for datakontaminasjon, og et team av olympiademedaljører kategoriserer hver oppgave ut fra hvilke ferdigheter som kreves, og gjennomfører en linje-for-linje-analyse av mislykkede modellgenererte løsninger.
Forskerne brukte Live Code Bench Pro-verktøyet til å teste flere av de mest populære og kraftigste KI-modellene. De kom da til den konklusjonen at ingen av modellene klarte å løse noen av oppgavene på den høyeste vanskelighetsgraden – selv ikke den mest potente kandidaten i studien, Open AIs o4 mini-modell.
På middels vanskelighetsgrad klarte o4 mini kun å løse 53,5 prosent av oppgavene, mens tallet lå på 83,1 prosent for de enkle oppgavene.
– Sliter med nyansert resonnering
Etter Codeforces' rangeringssystem fikk Open AIs o4 mini-modell en poengsum på 2116, som er langt under poengsummen til de beste menneskelige aktørene på Codeforces' toppliste – hvor mange ligger på godt over 3000 poeng.
Den nest beste KI-modellen i studien var Googles Gemini 2.5 Pro. Denne klarte altså heller ingen av de vanskelige oppgavene og løste også kun 25,4 prosent av de middels vanskelige oppgavene og 70,4 prosent av de enkle oppgavene.
– Vi finner at avanserte modeller fortsatt har betydelige begrensninger. [...] Vi ser også at språkmodeller lykkes på oppgaver som krever mye implementering, men sliter med nyansert algoritmisk resonnering og kompleks analyse av spesialtilfeller, og genererer ofte selvsikre, men feilaktige begrunnelser, skriver forskerne i sin oppsummering.
Alle detaljene kan du finne i det relativt omfattende forskningsdokumentet.