roboter

Ingen kode: Toyota lærer opp roboter som om de var barn

Robotene lærer raskt å snu pannekaker eller sortere varer på et transportbånd – uten programmering.

Roboten lærer som et barn ved å etterligne en voksen person.
Roboten lærer som et barn ved å etterligne en voksen person.

Den japanske bilprodusenten Toyota vil automatisere hverdagsoppgaver på kjøkkenet med roboter. Nå har de presentert en løsning på hvordan man raskt kan lære roboter å snu pannekaker, knekke egg i en bolle eller skrelle poteter.

Toyotas amerikanske utviklingsavdeling, Toyota Research Institute (TRI), har så langt lykkes med å lære roboter å utføre mer enn 60 oppgaver, som å måle opp væsker, bruke verktøy og manipulere fleksible gjenstander. Alt sammen uten å skrive en eneste linje med programkode.

I stedet har TRI fått et menneske til å demonstrere oppgaven for robotene én gang.

Kanskje roboten kan ende opp som en utdannet kokk? Her piskes det egg. Foto: TRI
Kanskje roboten kan ende opp som en utdannet kokk? Her piskes det egg.

TRIs robotmodell lærer av haptiske demonstrasjoner (berøring) fra et menneske kombinert med en tekstbasert beskrivelse av oppgaven. Deretter bruker den en kunstig intelligens-modell (KI) som kalles Diffusion Policy til å lære roboten oppgaven. Denne prosessen betyr at roboten ikke trenger å se oppgaven utført mange ganger med små variasjoner.

Med et kamera ser roboten hvordan oppgaven utføres og får haptisk tilbakemelding, altså trykk, bane og hastighet. Til slutt behandler en generativ KI-algoritme inndataene slik at roboten lærer seg å håndtere ulike variasjoner av oppgaven.

No code-løsningen er ikke bare raskere, men åpner også for at roboter kan ta på seg mer komplekse oppgaver enn å skru i skruer eller sortere varer på et transportbånd.

– Raskt og pålitelig

Ifølge TRI er nøkkelen til den nye, raskere programmeringsmetoden en spesiell form for generativ kunstig intelligens der algoritmer kan generere (skape) innhold basert på datainput.

Det er litt som når Midjourney skaper et visuelt bilde etter at du har skrevet inn ordene himmel, fly og solskinn. TRI kaller sin generative KI for «diffusion policy robots».

Selv om Toyota er mest kjent for å produsere biler, er mange oppgaver flyttet fra fabrikkgulvet til kjøkkenet, der en ny video viser roboter som skreller poteter, smører sjokoladepålegg på ristet brød og pisker egg.

– Det som er så spennende med denne nye tilnærmingen, er hvor raskt og pålitelig vi kan legge til nye ferdigheter. Fordi disse ferdighetene er basert direkte på kamerabilder og taktile sensorer (berøring) og kun bruker innlærte representasjoner, kan de også utføre oppgaver som involverer deformerbare objekter, materie og væsker, noe som tradisjonelt har vært ekstremt vanskelig for roboter, sier Russ Tedrake, visedirektør for robotikkforskning ved TRI.

Vil bygge store atferdsmodeller

Ifølge Toyota er dette det første skrittet i retning av å bygge atferdsmodeller, Large Behavior Models (LBM), for roboter, som ligner på de store språkmodellene (LLM) som nylig har revolusjonert chatbots som ChatGPT og Bard.

– Det høres spennende ut. Å lære opp roboter gjennom demonstrasjoner er på en måte robotteknologiens hellige gral, sier Jimmy Jørgensen, teknisk direktør i Nordbo Robotics, som utvikler kodefrie løsninger for roboter, for eksempel for polering.

Selv har han vært involvert i flere forsknings- og utviklingsprosjekter med nettopp dette formålet de siste 20 årene.

Roboter kan føle kraften i en oppgave

Det danske selskapet Nordbo Robotics har utviklet en lignende løsning, mimic, som registrerer bevegelser og konverterer dem til robotbevegelser. Løsningen brukes i applikasjoner som sliping, polering, maling eller helling av væsker. Dette er oppgaver som krever taktil input, for eksempel hvor mye kraft som skal brukes i en bevegelse. Denne typen taktil input er vanskelig for en robotprogrammerer å formulere, fordi man ikke bare må instruere roboten til å bevege seg fra punkt til punkt, men også ta hensyn til bevegelsens bane, hastighet og trykk.

Tenk bare på hvor vanskelig det er å skjenke opp en halvliter øl.

– Toyotas oppsett for opptak av demonstrasjoner kan på noen måter sammenlignes med våre plattformer. Det ser imidlertid ut til at de utelukkende bruker «demonstration by teleoperation». Det betyr at de fjernstyrer roboten når de gjennomfører en demonstrasjon. Det er veldig vanskelig for et menneske å fjernstyre noe så komplekst som et par robotarmer, og det resulterer nesten alltid i dårlige demonstrasjoner. Det betyr som regel at oppgavene utføres langsommere eller med mindre presisjon enn du ville forvente av et menneske, sier Jørgensen.

Robotindustrien nøler

Mange robotprodusenter og forskere kvier seg for å ta i bruk kunstig intelligens fordi de fysiske systemene ikke kan nøye seg med tekst- og bildeinput, altså data i 2D, når oppgaven skal utføres av en eller flere robotarmer som kan bevege seg i nær sagt alle retninger med seks ledd.

TRI prøver å tilføre flere dimensjoner til demonstrasjonene sine ved å gi haptiske og taktile sensorinndata til roboten når den introduseres for en ny oppgave. Slik kan den se, men også føle og fornemme hvor mye kraft den trenger til en gitt oppgave.

Bilprodusenten Tesla prøver å utvikle en menneskelignende robot som kan automatisere hverdagslige oppgaver. Her er en ny video av roboten Optimus.

Andre prosjekter prøver å bruke syn og kunstig intelligens til å forstå eller lære oppgaver mer direkte fra et menneske, noe som gir mye bedre data om hvor godt oppgaven utføres.

Det er her Toyotas fokus på taktil og haptisk tilbakemelding ser ut til å fungere.

– Det ser ut til at de har klart å lære robotene bevegelser kombinert med visuell og taktil input, noe som er vanskelig, men nødvendig i mange oppgaver. Standardroboter er både blinde og følelsesløse og kan derfor bare operere i svært statiske omgivelser der alle endringer er 100 prosent forutsigbare. Det er absolutt fornuftig å finne metoder, som det Toyota gjør, for å gjøre roboter enklere å programmere eller instruere, sier Jørgensen.

Hvis oppgaven blir mer komplisert, blir læringen også mer avansert ved at menneske og robot kobles sammen, slik at operatøren får taktil tilbakemelding fra roboten og kan føle hvor mye kraft som må brukes på en oppgave.

Dette gjøres med såkalte soft-bubble-sensorer. Dette er en taktil sensor som består av et internt kamera som observerer en oppblåst fleksibel membran. På denne måten kan sensoren måle mer enn signalene fra kraftmoment-sensorene, slik at roboten kan oppfatte romlig informasjon om kontaktmønster, geometri og kraft.

Soft-bubble-sensorer er ikke noe nytt, men det har tidligere vært vanskelig å utnytte dataene til robotprogrammering.

Er fortsatt var for endringer

Toyota Research Institute sier at AI-algoritmen er nøkkelen til å forstå og utnytte denne typen sensordata.

Modellen er imidlertid ikke perfekt ennå. Instituttet innrømmer at når en robot lærer seg en ny ferdighet, er den sårbar for endringer i omgivelsene. Typisk oppstår det feil hvis kameraets synsvinkel eller bakgrunn endres, eller hvis det plutselig dukker opp forstyrrende objekter, for eksempel rot, i robotens synsfelt.

Jørgensen påpeker at det neppe er tilfeldig at Toyota har flyttet testene fra et industrielt miljø til et kjøkken.

– Jeg vil ikke tro at denne metoden vil bli brukt i industriell produksjon i løpet av de nærmeste årene. Robotene skal ikke bare være enkle å programmere, de skal aldri gjøre feil, og de forventes å være raskere og mer nøyaktige enn mennesker.

Denne kombinasjonen av hurtighet og null feil er vanskelig å oppnå, noe man også kan se i Toyotas video, der en robot langsomt og famlende forsøker å finne pannekaken.

– «Tenkende» roboter vil, i likhet med tenkende mennesker, gjøre feil og trenger tid til å lære. Jeg tror at de de først og fremst vil bli brukt i andre sammenhenger, der forventningene til dem er annerledes enn i tradisjonell industri. Det kan for eksempel være i serviceyrker, og spesielt til oppgaver der det ikke er kritisk å gjøre feil.

Artikkelen ble først publisert på Ingeniøren for deres abonnenter. Den er tilgjengelig på norsk for abonnenter av Ekstra gjennom vår samarbeidsavtale.

Powered by Labrador CMS