kunstig intelligens
Studie: Noen utviklere jobber mindre effektivt med kunstig intelligens
Bruker mye tid på korreksjoner, sier forskere.
Et av områdene hvor KI-teknologien har fått størst innflytelse er innen programmering, et felt hvor mange av de seneste KI-modellene presterer meget skarpt.
Nå har det dukket opp en ny studie som til en viss grad utfordrer den uforbeholdne optimismen mange programvareingeniører har overfor KI-teknologien. Det rapporterer blant andre nyhetsbyrået Reuters.
Brukte flere hundre kodeoppgaver
Den nye studien ble utført av METR (Model Evaluation & Threat Research), et forskningsinstitutt som evaluerer KI-systemers evne til å utføre oppgaver uten menneskelig innblanding.
Forskerne bak studien ønsket å finne ut hvor stor effekt de nyeste KI-modellene, inkludert modeller lansert så sent som i juni i år, har for produktiviteten til en gruppe erfarne programvareingeniører som bruker KI i arbeidet sitt.
Utviklerne i studien hadde i snitt fem års erfaring med åpen kilde-koding, og ble gitt 246 ekte utviklingsoppgaver fra modne kodeprosjekter av høy kvalitet på GitHub.
Hver oppgave kom med tilfeldige krav om å enten bruke eller la være å bruke KI-verktøy – mer spesifikt Anthropics Claude 3.5/3.7 Sonnet-modell med det populære KI-kodeverktøyet Cursor Pro.
Samtlige av deltakerne i studien va av den klare oppfatningen at KI-verktøyene ville gjøre dem mer produktive, men overraskende nok var resultatene langt mindre entydige.
19 prosent lengre tid med KI-verktøy
– Når utviklere får bruke KI-verktøy, tar det dem 19 prosent lengre tid å fullføre oppgavene – en betydelig nedgang i produktivitet som går imot både utviklernes egne forventninger og ekspertenes prognoser, skriver METR, og fortsetter:
– Avstanden mellom oppfatning og virkelighet er slående: utviklerne forventet at KI ville gjøre dem 24 prosent raskere, og selv etter å ha opplevd nedgangen, trodde de fortsatt at KI hadde gjort dem 20 prosent raskere.
Forskerne identifiserte 20 mulige forklaringer på den negative effekten som KI-verktøyene hadde på produktiviteten, og kom frem til fem faktorer som de mener er de mest sannsynlige.
METR mener én av faktorene simpelthen er en overoptimisme på vegne av KI-teknologiens nytteverdi, som ikke alltid gjenspeiles i virkeligheten. En annen faktor var at KI-verktøyene fungerte som en «sinke» og var vanskelige å bruke effektivt i de tilfellene hvor utviklerne var godt kjente med prosjektene/oppgavene.
Utviklerne i studien rapporterte i tillegg at verktøyene presterte merkbart svakere i store og kompliserte miljøer, og generelt var også påliteligheten til KI-hjelpemidlene begrenset. Utviklerne aksepterte under 44 prosent av den KI-genererte koden, ifølge forskerne.
Andre rapporter med lignende funn
Majoriteten av utviklerne rapporterte at de måtte gjøre store endringer for å «renske opp» den KI-genererte koden, og rundt 10 prosent av tiden ble benyttet til å evaluere/korrigere KI-koden.
I tillegg rapporterte utviklerne at KI-en ikke utnytter viktig «uskreven» kunnskap eller kontekst i arbeidet.
Forskerne understreker at funnene ikke må tolkes dithen at KI ikke bidrar til økt effektivitet for mange, eller til og med de fleste, utviklerne. De tas også forbehold om at KI-teknologien utvikles og forbedres i raskt tempo.
Studien underbygger tidligere undersøkelser. Digi skrev tidligere om en rapport basert på data innhentet fra 800 utviklere som bruker Github Copilot, som konkluderte med at effektivitets- og kvalitetsforskjellene var små, og at KI-assistenter kan også bidra til nye problemer.
For eksempel kom studien frem at KI-assistentene i snitt introduserte 41 prosent flere feil (bugs) i koden enn før verktøyet ble tatt i bruk.
Som METR-forskerne antydet i denne seneste studien blir modellene imidlertid raskt bedre. Den seneste Grok-modellen fra Elon Musk skal for eksempel ha slått samtlige av konkurrentene i ytelse – ikke minst innen koding.