kunstig intelligens

Maskinlæring: Forsterkende læring er perfekt når du ikke kan bygge et datasett

Forsterkende læring (reinforcement learning) er en av de trendene innen data science som mange mener vil få et stort potensial.

AWS demonstrerer forsterket læring med bilen DeepRacer.
AWS demonstrerer forsterket læring med bilen DeepRacer.

Når man ser på eksempler på oppgaver som kan løses med forsterkende læring, kan man lett få inntrykk av at teknikken primært er brukbar innen spillutvikling.

Metoden er for eksempel atskillige ganger blitt brukt til å beseire mobilspillet Angry Birds. I OpenAIs toolkit til forsterkende læring kan man måle krefter med klassikere som Pong og Space Invaders. Og da en AI nylig beseiret mennesker i skytespillet Quake III Arena var det forsterkende læring som sto bak seieren.

Julien Simon

Julien Simon er maskinlærings- og AI-evangelist hos Amazon Web Services. Han har dessuten erfarong som CTO i Viadeo, Pixmania og Aldebaran Robotics, samt som VP for engineering hos Criteo.

Dette er både bra og dårlig, mener Julien Simon, som er maskinlærings-ekspert hos AWS, da danske DataTech møter ham i Stockholm.

– Det er bra, fordi det viser at her er det noe som er vesentlig annerledes enn detektering av svindel (fraud detection) eller analyser av frafall (churn prediction) – vanlige bruksmønstre (use cases) for maskinlæring. Det er morsomt, og alle kan forstå det, sier han.

– Men det er også ikke helt bra, fordi fokus på gaming får folk til å tro at forsterkende læring bare er for dataspill. Og de bruksmønstrene tiltrekker seg oppmerksomhet, så jeg kan godt forstå hvordan kan få et slikt inntrykk.

Hos AWS la man på slutten av fjoråret inn forsterkende læring i skykjempens Sagemaker-verktøy, som brukes til å utvikle og håndtere maskinlærings-modeller. Begrunnelsen er den samme som for alle andre tiltak, sier Julien Simon: Det blir etterspurt.

Gulrot og pisk

Forsterkende læring er vesentlig annerledes enn både kontrollert og ukontrollert maskinlæring. I stedet for å lære av et datasett, skal en såkalt agent samhandle med et simulert miljø, og på bakgrunn av dette lære konsekvensene av forskjellige handlinger.

Ved å gi agenten belønning for å gjøre det riktige – og straffe den for det motsatte – blir agenten på sikt oppdratt til å løse det problemet som man vil at den skal løse – som for eksempel å lære å gå, slik som videoen under fra Google DeepMind viser.

Nettopp fordi et spill utgjør et godt simuleringsmiljø, er det et opplagt sted å begynne med forsterkende læring. Men det er bruksmønstre i mange forskjellige bransjer, forteller Julien Simon.

– Bedriftene som etterspør dette, har ett felles trekk. De jobber på områder hvor det nærmest er umulig å bygge et datasett, forklarer han.

– Hvis du foretar kontrollert eller ukontrollert læring, har du et datasett, og det må du bygge. For kontrollert læring er dette noe som tar lang tid og krever en stor innsats. Men i noen bedrifter er det ganske enkelt ikke mulig.

Dette gjelder for eksempel bedrifter som vil bygge en modell som forteller hvor de skal bore etter olje. De kan ta alle dataene om alle boringene sine fra årtier tilbake, men det er fremdeles så mye diversitet på planeten vår at det nødvendige datasettet er svært vanskelig å sette sammen, forklarer Julien Simon.

– Det samme kan du si om selvkjørende biler. Kan du bygge et datasett som fungerer under alle omstendigheter? Hvis du bygger et datasett for Israel, trener modellen på den og bringer den til Stockholm om vinteren, fungerer den ikke. Den modellen har aldri hørt om snø og is på veien. Du kan umulig gå gjennom alle de mulighetene som eksisterer.

Et annet eksempel er aksjemarkedet.

– Du kan hente inn data for alle priser for alle ting. Men vi vet jo at det er ting som påvirker markedet som vil være utenfor datasettet, sier Julien Simon:

– Disse ultradynamiske og ultra-uforutsigbare miljøene kan du ikke bygge et datasett for. Og det er her forsterkende læring kommer inn i bildet. Hvis det ligner kaos, og hvis det ser ut til at prisen for bare å prøve seg fram er høy, gir det mening å bygge en simulator og trene i den.

Litt Python eller et enormt MATLAB-prosjekt

I stedet for å bygge et datasett, bygger du i forsterkende læring en simulator til å trene en agent. Det er her som kompleksiteten i forsterkende læring ligger, understreker Julien Simon:

– Du er nødt til å ha en simulator som er tett nok på den virkelige verden.

I noen tilfeller er dette enkelt. Hvis man vil trene modeller til roboter, er det miljøer som AWS' RoboMaker og OpenAI's RoboSchool tilgjengelige. I andre sammenhenger finnes EnergyPlus for å simulere energisystemer. I flere bransjer bruker man allerede systemer som MATLAB til å foreta simuleringer.

– Vi har en stor kunde i oljeindustrien som jeg ikke kan røpe navnet på, og de har allerede en simulator, fordi de må forutse hvordan en spesifikk boring vil forløpe. Det trenger jo heller ikke være en 3D-verden. Det kan både være noen hundre linjer i Python, og det kan være et enormt prosjekt i MATLAB, sier Julien Simon.

Et godt verktøy

Andre AWS-kunder som i dag benytter seg av forsterkende læring, er Honda, moderselskapet Amazon og investeringsselskapet Tradelegs, som bruker forsterkende læring til å bygge modeller som kan slå aksjemarkedet, forteller Simon.

Et annet ikke navngitt selskap bruker metoden til å optimere intelligent inneklima.

– Hvis du vil optimere oppvarmning og kjøling i store bygninger, er det igjen veldig vanskelig å bygge et datasett. De har bygd en simulator og trent en modell. Og de fant fram til at de kunne redusere med 40 prosent av kostnadene i forhold til den regelbaserte modellen, sier Julien Simon.

På spørsmål om hvorvidt inntoget av forsterkende læring vil bli like betydningsfull som utbredelsen av dyp læring har vært de siste årene, understreker Julien Simon at teknikken fremdeles er ny.

– Vi har noen innovative kunder som jobber med dette, og vi er glade for å understøtte det. Min personlige mening er at forsterkende læring ikke vil få innpass på samme måte som dyp læring. Jeg tror at det også er et annet verktøy som du kan bruke når du har problemer med datasett. Men det er uansett et greit verktøy å ha.

Saken ble først publisert på danske Datatech, og gjøres tilgjengelig på norsk for abonnenter av Digi Ekstra gjennom vår samarbeidsavtale med Teknologiens mediehus/Ingeniøren.

Powered by Labrador CMS