kunstig intelligens
Setter spørsmålstegn ved effekten av nevrale nettverk
Kun 1 av 18 algoritmer gir bedre resultat enn enkle tommelfingerregler, viser ny rapport.
En ny vitenskapelig artikkel setter nok en gang spørsmålstegn ved effekten av nevrale nettverk til maskinlæring.
Nesten alle av 18 algoritmer for dyp læring («deep learning) som i de seneste årene har vært fremlagt på de fineste vitenskapelige konferanser, viser seg å ha store problemer når det kommer til stykket.
Kun sju av algoritmene er mulige å reprodusere med en fornuftig innsats. Av disse klarer seg dårligere enn bare en enkel algoritme med tommelfingerregler.
Kun én av 18 algoritmer gir klart bedre resultater enn de enkle metodene.
Det fremgår av en ny vitenskapelig artikkel med tittelen «Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches», skrevet av forskerne Maurizio Ferrari Dacrema, Paolo Cremonesi og Dietmar Jannach fra italienske og østerrikske universiteter.
Deep learning er den foretrukne metoden
Dyp læring er en populær måte å drive maskinlæring på, hvor det benyttes nevrale nettverk med mange såkalte skjulte lag. Teknikken har gitt resultater spesielt innenfor visuell gjenkjenning, som det ikke har vært mulig å oppnå med andre typer algoritmer.
De tre forskerne har sett nærmere på problemet «top-n recommendation».
Det er ganske enkelt den algoritmen som brukes når en kunde på et nettsted som Amazon får anbefalinger av produkter, som algoritmen gjetter på at kunden vil være interessert i. Problemet løses som regel ved å se på hva andre brukere på nettstedet, som også ligner kunden, har kikket på.
«Deep learning-teknikker er blitt den foretrukne metoden for forskere som jobber med algoritmiske aspekter av anbefalingssystemer», skriver forskerne i artikkelen.
«Med den sterkt økende interessen for maskinlæring generelt, er det blitt vanskelig å holde styr på det nyeste på området, for eksempel i forbindelse med top-n recommendation-oppgaver. I tillegg påpeker flere nye artikler problemer i dagens forskningspraksis i anvendt maskinlæring, for eksempel reproduserbarheten av resultatene eller valg av sammenligningsgrunnlag når man foreslår nye modeller».
ITU-forsker: Dyp læring gjør det lettere å bli publisert i tidsskrifter
De tre forskernes generelle konklusjoner gjenkjennes av Sebastian Risi, som er adjunkt ved IT-Universitetet i Danmark og ekspert på dyp læring og kunstig intelligens. Han sier:
– Det er vanligvis meget viktig å overveie reproduserbarhet. I en masse aktuell forskning på maskinlæring er det for tiden vanskelig å reprodusere de resultater som forskerne har offentliggjort. Det viktigste trinnet er at alle skal stille deres kode til rådighet, så resultatene lett kan reproduseres. Det er noe som visse konferanser beveger seg imot, ved å gjøre det obligatorisk å offentliggjøre koden.
Han fortsetter:
– Mange forskere bruker dyp læring som et buzzword i artikler, fordi det er mer sannsynlig at artikkelen din blir akseptert i et tidsskrift hvis du bruker fancy og sexy ord som deep learning, i stedet for å si at du brukte en meget enkel modell – og oppnådde den samme ytelsen. Dette er et betydelig problem akkurat nå. Folk bruker komplekse modeller før de overveier enkle modeller som kanskje har samme ytelse. Det låter bedre hvis du sier at du bruker deep learning, enn en enkel lineær klassifikasjon, som i visse tilfeller kan oppnå den samme ytelsen.
Det er forbundet med den aktuelle hypen rundt kunstig intelligens, mener Sebastian Risi. Alle snakker om dyp læring, så hvis man ønsker at ens forskning skal nevnes, hjelper det å ha begrepet med i tittelen på sin forskningsartikkel.
Men det skaper ikke bedre forskning, er hans synspunkt.
Reproduserbarhets-krisen
Det har gjennom flere år vært bekymring for at mange tekniske, naturvitenskapelige og andre kvantitative forskningsresultater ikke lar seg reprodusere.
Bekymringene kom blant annet til uttrykk da den amerikanske biofarmasøytiske virksomheten Amgen ville etterprøve banebrytende forskningsresultater som var beskrevet i 53 vitenskapelige artikler. De kunne bare bekrefte resultatene i seks av artiklene.
«Det var et sjokkerende resultat», skrev en tidligere forskningsleder for Amgen i tidsskriftet Nature i 2012.
Det er også kjent at forskning på kunstig intelligens og maskinlæring lider under dette problemet.
I fjor skrev tidsskriftet Science at en stikkprøve på 400 algoritmer presentert på to konferanser om kunstig intelligens viste at kildekoden bak algoritmen kun var offentliggjort i seks prosent av tilfellene. I kun en tredjedel av tilfellene var det offentliggjort hvilke data algoritmen var testet opp mot. For halvparten av algoritmene i stikkprøven hadde forskerne kun fremlagt pseudokode, som er et sammendrag av en algoritme.
– Jeg tror at mange utenfor våre forskningsmiljøer antar at fordi vi bruker kode, er reproduksjon alltid en mulighet. Slik er det langt i fra, uttalte Nicolas Rougier, som er tilknyttet Frankrikes nasjonale institutt for informatikk, i den forbindelse til Science.
Behov for mer stringens og bedre forskningspraksis
De tre forskerne slår i den nye artikkelen fast at problemet har eksistert i mange år. Allerede i 2009 viste en analyse at noe ikke stemte med de resultater som ny forskning kom med. Det på tross av at det fortsatt ble offentliggjort mange forskningsartikler på området.
I den nye artikkelen påpeker forskerne en rekke faktorer som bidrar til denne tendensen. Det dreier seg om dårlige sammenligningsgrunnlag som ikke reelt utfordrer dyp læring-algoritmene, samt vanskeligheter med å sammenligne og gjengi resultater på tvers av forskningsartikler.
Forskerne har stilt to spørsmål: I hvilken grad kan de nye resultatene reproduseres med en fornuftig innsats, og i hvor høy grad er de samme resultatene egentlig en forbedring sammenlignet med enkle, men finjusterte metoder.
Konklusjonen er, som tidligere nevnt, at det ofte er vanskelig å reprodusere resultater, og at de enkle metodene ofte gir resultater som er like gode som med dyp læring.
Derfor er det også behov for mer stringens og bedre forskningspraksis, med hensyn til en faglig vurdering av algoritmeforskning på dette området, lyder forskernes anbefaling.
Artikkelen er levert av vår samarbeidspartner Version2.dk, en del av Teknologiens Mediehus.