kunstig intelligens
Forskere advarer: Vitenskapen bak kunstig intelligens er i trøbbel
Maskinlæring får enormt mye oppmerksomhet for tiden. Nå advarer forskere om at hypen truer troverdigheten for vitenskapen bak.
Med en nøyaktighet på over 95 prosent kan kunstig intelligens (AI) forutsi borgerkrig. Det framgår av flere forskningsstudier, og andre har vist at kunstig intelligens kan diagnostisere autisme og forutsi for tidlig fødsel.
Det er bare ett problem: Ingen av disse forskningsresultatene kan reproduseres, altså at man vil få samme resultat om man gjør forsøkene på nytt. Og de er en del av en tendens som holder på å bli til et stort problem for forskningen på kunstig intelligens.
– Hovedårsaken til at forskning må kunne reproduseres, er at det er den eneste måten vi kan stole på de resultatene som legges fram, forklarer Sayash Kapoor.
Han forsker på maskinlæring ved Princeton University i USA og har i år, sammen med professor Arvind Narayanan, gjort seg bemerket gjennom en oppsiktsvekkende studie om reproduserbarheten ved forskning på kunstig intelligens.
I september 2018 offentliggjorde bare 25 prosent av de vitenskapelige artiklene innen maskinlæring koden som lå til grunn for forskningen. Og i september i år hadde andelen falt til 24 prosent, framgår det av den anerkjente årlige rapporten State of AI, som utarbeides av uavhengige investorer og revideres av AI-eksperter.
Men mangelen på publisert kode er bare én av faktorene som utfordrer reproduserbarheten. Når andre forskere har forsøkt å gjenskape bemerkelsesverdige resultater – selv med adgang til den opprinnelige koden – har de kommet fram til helt andre konklusjoner.
For kunstig intelligens er ikke flink til å forutsi borgerkriger. Og både fødsler og autisme skaper problemer.
Kan man forutsi krig?
Forskningen til Narayanan og Kapoor viser at kunstig intelligens har vært med på å skape en reproduserbarhetskrise innen forskning på alt fra borgerkrig og kvantefysikk til medisin. Men det var egentlig ikke det de to hadde satt som mål:
– I første omgang så vi ikke på reproduserbarhet. Vi ville undersøke hvorfor maskinlæring fungerer så godt på tvers av så mange ulike vitenskapelige områder, forteller Kapoor og viser til at maskinlæring er et mye brukt verktøy på mange forskningsfelt.
– Vi studerte blant annet forskning som tyder på at maskinlæring – med en nøyaktighet på over 95 prosent – kan forutsi hvilke borgerkriger som vil bryte ut i løpet av det neste året. Så det området bestemte vi oss for å fokusere på, sier han.
Men det var noe som ikke stemte:
– Vi fant ut at alle forskningsartiklene inneholdt feil.
Feilene lå vanligvis i koden som lå til grunn for resultatene, og når de ble rettet, stemte ikke lenger resultatene.
I Danmark har man i flere tilfeller sett lignende problemer, imidlertid med motsatt fortegn. I 2020 kunne avisen Berlingske for eksempel fortelle at det prestisjetunge vitenskapelige tidsskriftet Nature hadde trukket tilbake en fire år gammel dansk forskningsartikkel. I artikkelen hevdet forskerne Jacob Sherson og Klaus Mølmer at mennesket er bedre enn en kunstig intelligens når det gjelder å løse optimeringsproblemer innen kvantefysikk.
Det viste seg å ikke være riktig, og i koden som lå til grunn for forskningen, så man hvorfor: Det hadde blitt begått noe så banalt som en fortegnsfeil; Det var satt et minus der det skulle ha vært et pluss. Og når man rettet den feilen, var maskinen faktisk flinkere.
Nesten som magi
Den typen vitenskapelige feil bør naturligvis ikke slippe gjennom fagfellevurderingen. Når de likevel gjør det, skyldes det blant annet at hypen rundt kunstig intelligens har tatt overhånd, mener Sayash Kapoor:
– Maskinlæring anses ofte som ufeilbarlig, konstaterer han.
Man kan også lett bli forført. Vi har sett hvordan maskinene kan diagnostisere brystkreft, gjenkjenne objekter og ansikter og til og med frambringe fotorealistiske bilder av mennesker som aldri har eksistert.
– Særlig de siste ti årene har vi sett fantastiske eksempler på hva maskinlæring kan få til. Men det kan føre til den feilslutning at maskinlæring alltid fungerer godt på alle områder, og til alle oppgaver, advarer Kapoor.
– Hvis du for eksempel lar en maskinlæringsmodell bestemme om et bestemt bilde forestiller en katt eller ikke, kan du alltid se på bildet og konkludere «Å, det er en katt». Men i mange andre tilfeller der forskning bruker maskinlæring, er resultatene mer uklare, ikke så svart-hvitt, eller det er snakk om å forutsi noe som ligger langt frem i tid. Det gjør det vanskeligere å evaluere modellene enn det er innenfor tradisjonell maskinlæringsforskning.
Spørsmålet er hvorfor det ikke blir plukket opp i fagfellevurderingen alle vitenskapelige artikler gjennomgår. Én av årsakene er nok at det nettopp er fagfeller som vurderer forskningen, mener Kapoor:
– Mange av forskerne som utfører og vurderer forskning basert på maskinlæring, er ikke utdannet innen datavitenskap. De har nok kompetanse innen eldre statistiske metoder, men de er først og fremst eksperter på sitt område, for eksempel medisin eller samfunnsvitenskap. Men de har bare overfladisk kunnskap om maskinlæring. Det er vanskelig å være ekspert på alt, sier han.
Hvis data lekker ut
Derfor undervurderer mange hvor vanskelig det kan være å bruke maskinlæring. Mange ting kan nemlig gå galt. Et vanlig problem er «datalekkasje».
Fenomenet kan oppstå i forbindelse med trening av en modell på historiske data. Det gjør man med å ta et datasett og splitte det opp i et treningssett og et testsett. Testsettet brukes til å evaluere om modellen faktisk kan gjenkjenne mønstrene den skulle lære fra treningssettet. Det virker jo enkelt i praksis, for man kan jo bare splitte datasettet tilfeldig i to grupper ...
– Men noen ganger er det ikke nok med en tilfeldig deling, innvender Kapoor. Han forklarer at hvis man for eksempel har pasientdata med flere observasjoner per pasient – kanskje blodprøver – vil en tilfeldig oppdeling bety at den samme pasienten kan inngå i både treningssettet og testsettet:
– Da oppstår det en form for lekkasje fordi modellen både blir trent og evaluert på den samme pasienten.
Det finnes flere lignende avhengigheter og fallgruver når man jobber med store datasett. Kapoor maner til forsiktighet:
– Ellers kan maskinlæringsmodellene gi overdrevent optimistiske resultater, advarer han.
329 ugyldige artikler
Forskningen til Kapoor og Narayanan har så langt ført til den mye omtalte forskningsartikkelen «Leakage and the Reproducibility Crisis in ML-based Science», som tidligere i år ble publisert på Cornell Universitys åpne prepubliseringsarkiv, Arxiv. I artikkelen beskriver de hvordan de oppdaget at datalekkasje forekommer på en rekke felt. I tillegg arrangerte forskerne et seminar om datalekkasje der 1700 forskere fra hele verden og mange ulike disipliner deltok.
Interessen for seminaret gleder Princeston-forskerne, men de er egentlig ikke overrasket, for datalekkasje er et vanlig problem. I forskningsartikkelen sin har de identifisert over 17 ulike områder der man finner forskningsartikler som inneholder datalekkasje som gjør at resultatene ikke kan reproduseres. Blant annet de overoptimistiske resultatene om borgerkriger – pluss 328 andre artikler.
– Forskerne har trodd at datalekkasje var noe som bare fantes på deres felt, forklarer Kapoor og bemerker at det kommer av selve terminologien rundt datalekkasjer.
– På noen felt kalles det gyldighetssvinn, noen kaller det sammenblanding, andre kaller det noe helt annet. Så de ulike vitenskapelige feltene har faktisk taklet det samme problemet, men med mange ulike navn og tilnærminger, noe som også gjør at det har vært en del dobbeltarbeid.
Vanskelig å trekke tilbake
Men det er ikke bare dobbeltarbeidet og de ugyldige forskningsresultatene som gjør datalekkasje og manglende reproduserbarhet til et problem. En annen utfordring er forskningens «arvelighet». Det kan nemlig ta år før feilaktige forskningsartikler blir trukket tilbake, og i mellomtiden kan artiklene bli sitert mange ganger.
I tilfellet med den danske kvanteforskningen som Nature trakk tilbake, nektet forskerne først å levere ut koden bak resultatene – selv om en skeptisk forsker fra Harvard hadde bedt om det. Det tok til tre år, og artikkelen ble ifølge Google Scholar sitert over 120 ganger før de danske forskerne utleverte koden og fortegnsfeilen ble oppdaget.
Selv om det ofte tar lang tid, er det mulig å trekke tilbake feilaktige resultater, men det er ikke noen garanti mot at andre forskere fortsatt siterer artiklene.
– Selv etter at disse ikke-reproduserbare resultatene har blitt avvist, trukket tilbake eller at man på andre måter har funnet ut av feilen, blir artiklene fortsatt sitert, forteller Kapoor.
Han forteller at forskeren Marta Serra-Garcia har dokumentert at ikke-reproduserbare forskningsartikler siteres oftere enn andre.
Det betyr noe
Kapoor understreker at problemene kan ha store konsekvenser – særlig fordi forskning danner grunnlag for mer forskning:
– Alle disse vitenskapelige framskrittene er basert på konsensus (enighet). Det er en konsensus blant forskere der alle tror på og stoler på at de resultatene som rapporteres fra et eksperiment, holder og tåler å bli etterprøvd, sier han.
– Men hvis man ikke kan reprodusere resultatet, er det ikke særlig nyttig, sier Kapoor. Han påpeker at det i ytterste konsekvens kan bety at det vitenskapelige korthuset kollapser, ettersom nye resultater står på skuldrene til eldre resultater.
Reproduserbarhet er hele grunnlaget for forskningen, påpeker Kapoor. Det er samfunnets garanti for at forskningen holder mål.
Denne artikkelen ble først publisert på Version 2 for deres abonnenter. Den er tilgjengelig på norsk for abonnenter av Ekstra gjennom vår samarbeidsavtale.