robotautomatisering
Slik kan roboter programmere seg selv
Google-prosjekt imponerer AI-forskere ved norske universiteter, men de understreker at teknologien ikke er helt til å stole på ennå.
Google-forskere har utviklet en språkmodell basert på kunstig intelligens, der roboter selvgenererer den nødvendige Python-koden for å utføre kommandoer gitt i vanlig hverdagsspråk. Dermed klarer robotene å utføre konkrete oppgaver på egen hånd kun basert på en vanlig beskjed, korte kodeklipp eller kommentarer.
Videoer fra prosjektet Code as Policies viser hvordan en robotarm løser oppgaver som å tegne geometriske figurer, stable bestemte gjenstander i en bolle eller hente en colaboks fra et bord og putte den i den riktige beholderen for resirkulering. Basert på dette mener forskerne det lar seg gjøre å lage et rekursivt (gjentakende) system der robotene kan løse stadig mer komplekse oppgaver. Faren med systemet er ifølge Google-forskerne at språkmodellen kan begynne å «hallusinere», det vil si at systemet kan gi output som kan synes å være meningsfullt ved første øyekast, men som i virkeligheten kan være helt uten mening.
CAIR-forsker imponert
Professor Morten Goodwin fra Senter for kunstig intelligens ved Universitetet i Agder (CAIR) er imponert over hva forskerne fra Robotics-gruppen til Google har fått til, selv om dette ikke er det første eksempelet på at forskere har fått roboter til å ta imot kommandoer i vanlig hverdagsspråk. Han viser til selvkjørende biler i studien LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action
Samtidig forteller han at det også finnes en rekke YouTube-videoer som demonstrerer nettopp dette.
– Det å skrive kode i naturlig språk er i seg selv ikke noe nytt, kommenter han.
– Det Robotics-gruppen til Google gjør, er allikevel veldig imponerende. De demonstrerer en veldig høy presisjon på oppgaven, og det er en byggestein mot en helt annen måte både å skrive kode på og å trene roboter.
AI-eksperten og forfatteren fra Agder-universitetet understreker at dette helt klart viser at utvikleryrket er i massiv endring, takket være innovasjoner som dette, og at det vil føre til helt andre måter å trene roboter på.
– Snart vil jeg kunne si til støvsugerroboten at den skal konsentrere seg om matrestene under kjøkkenbordet, jeg kan fortelle gressklipperroboten at den skal unngå rosene eller industriroboten at den skal sette sammen bilen «slik og ikke slik». Dette helt uten å programmere den, forklarer han.
Goodwin forteller at Robotics-gruppen til Google i denne studien kombinerer flere forskningsfelt, både språkforståelse fra store språkmodeller, oversettelse til kode og tredje romlig forståelse, som «skålen til venstre for den grønne skålen».
– De gjør også dette til perfeksjon, sier han imponert.
– Faren for «hallusinasjoner» er nok ganske høy. Akkurat hvor stor den er, er vanskelig å si uten å kjenne systemet i mye mer detalj.
Når det gjelder muligheten for å hallusinere, forklarer Goodwin at det her betyr at roboten lager kode som i virkeligheten ikke fungerer.
– For AlphaCode, algoritmen som laget programkode for Google, var dette et veldig stort problem, og de måtte lage en egen algoritme for å kvalitetssikre koden som ble produsert, sier han.
– I dette demosystemet har det ikke noen store konsekvenser. Det betyr bare at roboten i beste fall ikke gjør noe fordi koden ikke fungerer, og i verste fall gjør noe helt feil som å flytte på den røde ballen istedenfor den grønne, forklarer Goodwin.
Samtidig understreker han at hvis vi tenker oss at systemet blir videreutviklet, for eksempel som en automatisk robot for å operere mennesker, eller en robot for å desarmere våpen, kan enhver feil være veldig kritisk.
Unik kombinasjon av komponenter
Digi har også bedt professor Stefano Nichele ved Høgskolen i Østfold om en kommentar til forskningsprosjektet. Han poengterer at roboten ikke bare tar imot kommandoer i vanlig dagligspråk og gjør den om til kode.
– I tillegg til å generere kode eller instruksjoner til å kontrollere roboten selv, bruker den API-er til «environment perception», altså til å forstå verden, kommenterer han.
Han mener likevel at det ikke er så mye nytt eller banebrytende i dette i seg selv, det vil si i de forskjellige komponentene.
– Det som egentlig er nytt her, er det å bruke alle disse komponentene sammen, påpeker han.
Språkmodeller eller LLM-er (Large Language Models) brukes til blant annet å forstå språk, til å genere kode og til robotkontroll.
– Disse LLM-ene kan man ikke stole 100 prosent på nå, men fagfeltet går fort, så det kan mest sannsynlig brukes om noen år til å kontrollere robotene med språk, ikke bare for bestemte eller forhåndsprogrammerte funksjoner, men ute i verden, tror han.
Nichele henviser til det Google-forskerne selv skriver i den vitenskapelige artikkelen:
«Kode som retningslinjer er et skritt i retning av roboter som kan endre oppførselen sin og utvide sine evner tilsvarende. Dette kan være mulig, men fleksibiliteten øker også potensielle risikoer, siden syntetiserte programmer (med mindre de kontrolleres manuelt per kjøretid) kan resultere i utilsiktet oppførsel med fysisk maskinvare. Vi kan redusere disse risikoene med innebygde sikkerhetssjekker som binder kontrollprimitivene som systemet har tilgang til, men mer arbeid er nødvendig for å sikre at nye kombinasjoner av kjente primitiver er like sikre. Vi ønsker en bred diskusjon om hvordan vi kan minimere disse risikoene, samtidig som vi maksimerer de potensielle positive effektene mot mer generelle roboter.»
Teknologien er med andre ord ikke helt ferdig til å tas i bruk ennå, og det er fortsatt en del problemer som må løses før den kan tas i bruk for fullt.
– Per nå er teknologien bare en demo og ikke helt til å stole på, avslutter AI-forskeren fra Høgskolen i Østfold.