kunstig intelligens
Slik skal kunstig intelligens lære å huske
Dagens kunstige intelligens har en feil. Med hver ny oppgave mister den de tidligere innlærte ferdighetene. Nå har forskerne kopiert et avgjørende triks fra dyrehjernen.
I 2015 laget selskapet Deep Mind sensasjon da et nevralt nettverk på egen hånd klarte å lære seg 49 klassiske Atari-spill. Systemet fikk som input bare de fargede pikslene på skjermen og spillereglene. Algoritmen lærte seg spillene ved å prøve og feile og ved å få belønning for gunstige beslutninger. Det viste seg likevel at når man forsøkte å trene opp algoritmen til en annen type spill som krevde en annen strategi, ble det nevrale nettet hjemsøkt av en katastrofal glemsomhet.
Algoritmen glemte rett og slett hvordan den tidligere hadde mestret de spillene den hadde lært.
Det er forståelig ut i fra hvordan kunstig intelligens fungerer. Når man trener et nettverk til bestemte oppgaver så blir de vektede tilknytningene mellom nettverkets kunstige nevroner tilpasset løsningen av oppgaven. Får systemet en ny oppgave blir de gamle vektingene overskrevet.
Forskere ved SRI International i Princeton har laget en løsning på problemet ved å studere den biologiske hjernen hos mus. Når en mus lærer noe forsterkes de aktuelle synapsene mellom de deltakende nervecellene. Hvis musa lærer noe nytt, beholdes de gamle forbindelsene med samme styrke. Sek Chai og hans kolleger ved Princeton hadde som mål å utvikle kunstig intelligens med livslang læring ved å bruke det biologiske forbildet som modell og har lyktes med å få de innebygde erindringskomponentene til å fungere på samme måten som hos mennesker.
Forskerne tok utgangspunkt i det nevrale nettverket som hadde lyktes med på egen hånd å lære Atari-spillet, men utstyrte det med spesielle algoritmer som skal redusere læringen på nøyaktig de vektede forbindelsene. Det betyr at jo viktigere en forbindelse var for mestringen av det forrige spillet, jo vanskeligere lar den seg tilpasse til det nye spillet og dermed overskrive. De forbindelsene som allerede er etablert blir tatt vare på og lagret i et Replay memory som er integrert i rammeverket til læringssystemet.
Systemet kan hente opp igjen læringseksempler fra minnet og kan trene seg opp på nytt basert på nye scenarier uten at de gamle forbindelsene blir overskrevet og slettet. Med den tilpassede algoritmen kunne det nevrale nettverket lære seg nye ting uten å bli hjemsøkt av katastrofal forglemmelse.
En relevant problemstilling, mener norsk forsker
Problemstillingen står på dagsorden for KI-forskere over hele verden.
– Katastrofal glemsomhet er et av de store problemene i kunstig intelligens-forskningen, bekrefter førsteamanuensis Morten Goodwin ved Senter for kunstig intelligens ved Universitetet i Agder.
– Kunstig intelligens og spesielt de nevrale nettverkene er inspirert av menneskehjernen, men hvis jeg lærer noe nytt, er det ikke slik at noe annet må vike. Hvis jeg bestemmer meg for å lære spansk, forsvinner ikke min kunnskap om engelsk. Derimot kan det være akkurat slik i de nevrale nettverkene. Dette kalles katastrofal glemsomhet.
CAIR-forskeren forteller at problemet gjelder spesielt i såkalt forsterkningslæring, som er fagfeltet Deep Mind jobbet med for Atari-spill.
– Forsterkningslæring er fagfeltet hvor en kunstig intelligensalgoritme hele tiden spiller i et miljø som Atari-spill eller sjakk. Hvis spillet endrer seg, vil algoritmene glemme de tidligere delene av spillet, fastslår han.
Han synes forskningen til Princeton-gruppen er veldig spennende, og mener helt klart at de kan være inne på noe.
– Eksperimentene er derimot veldig begrenset. De har vist dette for gjenskapning av håndskrevne tall, som er langt unna det å spille Atari-spill, påpeker han.
Ikke overbevist
–Vil det være et problem at Replay Memory vil vokse eksponentielt og bli uhåndterlig stort hvis systemet skal lære seg flere nye oppgaver?
– Det er utvilsomt slik at de nevrale nettverkene i Princton-algoritmen vil vokse når den skal huske hvordan flere oppgaver skal løses. Det blir rett og slett mer å huske på, sier han.
– Akkurat dette er ikke et veldig stort problem. Utfordringen er snarere å vite når den skal bruke hvilken kunnskap.
Han tar som eksempel at han har lært seg å spille fotball, og etterpå lærer å spille basketball. Da vil han enkelt kunne skille mellom når han skal sparke ballen og når han skal sprette den. Et vanlig nevralt nettverk, som har lært å spille et fotballspill, vil typisk glemme hvordan spille fotball når det lærer basketspillet. Basketballspillet går på bekostning av fotballspillet.
De aller fleste algoritmer i dag er bygget slik at de klarer å løse en og bare en oppgave
– Hvis algoritmen fra Princton brukes, vil den antagelig både huske fotballspilling og basket samtidig, tror han.
– Utfordringen er om den virkelig klarer å skjønne når den skal sparke ballen og når den skal sprette. Det er langt fra sikkert, ut fra eksperimentene som vises i artikkelen.
Goodwin forteller at CAIR ikke jobber spesifikt med dette problemet, men at det likevel gjennomsyrer mye av forskningen deres – spesielt det arbeidet som har med såkalt forsterkningslæring å gjøre.
– Vi jobber mye med algoritmer som skal få til flere oppgaver samtidig, typisk i spill. De aller fleste algoritmer i dag er bygget slik at de klarer å løse en og bare en oppgave, forteller han.
– I store kompliserte spill, skal ideelt algoritmene både lære mange oppgaver samtidig og i tillegg vite når de skal brukes.
Han tror Princeton-forskningen er viktig, men er usikker på om dette er det store gjennombruddet.
– Hvis dette virkelig er en løsning på katastrofal glemsomhet, kommer det til gjennomsyre mye av kunstig intelligens-forskningen fremover, men jeg er ikke helt overbevist, fastslår KI-eksperten fra Grimstad.
Må styre læringen
– Det ser ut som de kanskje er inne på en måte å styre læring på, kommenterer Bjørn Magnus Mathisen, forsker på kunstig intelligens ved NTNU.
– Skal man benytte seg av dette fullt ut må man også finne en måte å styre læringen på slik at like oppgaver blir lært på tilnærmet samme plass i det nevrale nettet, slik at det kan kodes mest mulig effektivt.
NTNU-forskeren, som også arbeider med biologisk inspirerte metoder, påpeker at Princeton-forskerne har utviklet en metrikk som gjør at man kan hente frem henholdsvis lignende eller ulike tidligere opplevelser, avhengig av hva man vil trene på nå.
– Samtidig er det viktig å vite om disse hendelsene er ulike internt, det vil si hvor de er representert internt i det nevrale nettet, og ikke bare eksternt, som de måler nå, påpeker han.
– Relatert til dette er «Active Learning», der man også prøver å se på svakhetene til det nevrale nettet man trener for å finne ut hva man helst bør trene på i neste skritt, som det jobbes med her på NTNU, forteller KI-stipendiaten fra Trondheim.
En relevant problemstilling
Professor Jim Tørresen ved Institutt for informatikk ved UIO bekrefter i en kommentar at problemstillingen er relevant. Den 19. til 22. august kommer 150 internasjonalt ledende forskere innen studier av læring og utvikling, det vil si biologisk intelligens, sammen fra hele verden til en konferanse i Oslo der temaet er hvordan mennesker lærer og utvikler seg og hvordan det kan komme til nytte for å lage bedre roboter.
KI-forskeren fra Oslo forklarer at inspiserbarhet og sporing er et problem med nettverkene som trenes innen dyp læring.
– En måte å få bedre innsikt i hva som er viktig i et nettverk er å visualisere deler av nettverket og hvordan vektene endres og opererer gjennom trening, forklarer han.
På den måten kan man forstå mer om virkemåten og også justere størrelsen på problemet som skal løses.
– Vi har sammen med blant annet forskere i Brasil publisert en oversikt over ulike måter å visualisere på innen dyp læring og også anvendt dette selv på å vise at det kan komme til nytte for å justere arkitekturen til et nettverk, forteller Tørrisen.
– Dette kan igjen anvendes til å skalere opp et nettverk når et nettverk skal trenes til å håndtere nye utfordringer uten å glemme de som allerede er lært.
– Vi har tilsvarende studert hvordan modeller innen robotikk kan trenes til å skille på å håndtere ulike typer objekter, som når de har ulik tyngde. En full og dermed tung kopp krever et annen løft enn en tom kopp. Her har vi vist at en kan optimaliser flere ulike modeller som samvirker for å håndtere ulike typer objekter. Et stikkord her er modularitet og hvordan det kan brukes til å få et nettverk til å bedre fungere i ulike situasjoner, forklarer robotikk-forskeren fra Oslo-universitetet.