kunstig intelligens

Ny studie: Lenge til KI-teknologien kan erstatte menneskelig innsats

Nytt ytelsesverktøy ga heller nedslående resultater.

KI kan fremdeles være et godt stykke unna å kunne automatisere alle menneskelige oppgaver, viser nye studie.
KI kan fremdeles være et godt stykke unna å kunne automatisere alle menneskelige oppgaver, viser nye studie.

Kunstig intelligens (KI) tar over menneskelige oppgaver i raskt tempo, og dette har fått mange til å lure på hvor langt utviklingen kan gå innenfor dagens teknologiske rammeverk.

Nå viser en ny studie at KI faktisk har større begrensninger enn mange kanskje tror når det gjelder automatisering av menneskelige oppgaver. Det skriver nettstedet Wired.

KI-selskapet Scale AI, i samarbeid med forskningsinstitusjonen Center for AI Safety (CAIS), har utviklet et nytt ytelsesverktøy for kunstig intelligens, døpt «The Remote Labor Index».

Testet på ekte prosjekter

Verktøyet er designet spesifikt for å måle KI-agenters evne til å utføre realistiske oppgaver av reell, økonomisk verdi på en empirisk måte. Dette ble gjort ved å sammenligne arbeidet utført av KI-agentene med en profesjonell arbeider som utførte de samme oppgavene.

Datagrunnlaget besto av 240 ekte frilansprosjekter fordelt på 23 kategorier, med en total kompensasjon på cirka 144.000 dollar for de menneskelige frilanserne.

Agentene som ble testet, inkluderte kinesiske Manus, Anthropics Claude Sonnet 4.5, Open AIs GPT-5 og Chat GPT Agent, samt Googles Gemini 2.5 Pro.

Hovedfunnet var heller begredelig – sett med effektiviseringsøyne. Forskerne fant at til og med den beste KI-agenten, Manus, ikke klarte å automatisere mer enn 2,5 prosent av oppgavene når den ble satt til å fullføre prosjektene fra start til slutt. Den estimerte verdien på arbeidet som ble utført var på bare 1700 dollar.

Manus er for ordens skyld en KI-agent utviklet av kinesiske Manus AI, som er designet spesifikt for å utføre oppgaver autonomt. Den ble lansert i mars i år.

Ufullstendig og lav kvalitet

Claude Sonnet 4.5 og Elon Musks Grok 4 kom på en delt andreplass og klarte 2,1 prosent av oppgavene på egen hånd. Open AIs modeller taklet 1,3 prosent og 1,7 prosent, mens Googles Gemini 2.5 Pro kun klarte 0,8 prosent av oppgavene i prosjektene.

Da forskerne undersøkte akkurat hva som ligger bak de svake resultatene, fant man at nesten halvparten av oppgavene som var løst av KI-agentene – 45,6 prosent – hadde betydelige kvalitetsproblemer som ikke tilfredsstilte den profesjonelle standarden.

35 prosent av de innleverte oppgavene var på ulike måter ufullstendige, med for eksempel forkortede videoer, manglende filer og tomme kataloger.

17,6 prosent hadde tekniske problemer, deriblant ubrukelige filer, mens 14,8 prosent av oppgavene manglet helhet og kontinuitet på tvers av de ulike filene i prosjektene.

De eneste oppgavene hvor KI-agentene gjorde det bra, var de som primært involverte generering av bilde og lyd, samt noen skriveoppgaver av den enklere sorten.

Ifølge forskerne viser resultatene at KI-agentene ennå ikke er gode nok til å kunne anses som pålitelige og detaljorienterte arbeidere.

Underbygges av andre rapporter

– Frykten for umiddelbar, omfattende automatisering støttes ikke av dataene; en feilrate på 97,5 prosent viser at KI ennå ikke er i stand til å utføre komplekst, profesjonelt arbeid autonomt. Vår analyse avdekker en kritisk forskjell mellom KIs ferdigheter på isolerte oppgaver og den helhetlige påliteligheten som kreves for å gjennomføre reelle oppdrag, skriver teamet.

Flere detaljer om funn og metodologi kan man finne i selve forskningsrapporten.

Oppfatningen om at KI ennå har et stykke igjen, underbygges av andre rapporter. En nylig publisert studie viste for eksempel av forskere har blitt mer skeptiske til KI-teknologiens pålitelighet etter hvert som omfanget har økt, og langt færre forskere mener nå at KI overgår menneskelige ferdigheter.

En annen stor undersøkelse indikerer at også utviklere har overraskende lav tillit til KI som verktøy, til tross for at dette er et felt hvor KI-teknologien nå brukes i stor skala.

Powered by Labrador CMS