utvikling

Maskinlæring blir dagligdags for IT-folk

Nye tjenester og verktøy skal gjøre det enklere for utviklere å benytte maskinlæring. Her er et par råd om hva du bør være oppmerksom på.

Nye tjenester skal gjøre det enklere å oppnå gode resultater med maskinlæring.
Nye tjenester skal gjøre det enklere å oppnå gode resultater med maskinlæring.

Er det opp til store nettskyleverandører som Amazon, Microsoft og Google, så skal det bli enklere for vanlige utviklere uten dataviterbakgrunn å benytte maskinlæring (ML) i IT-løsninger.

Den største nettskytilbyderen, Amazon, har gjennom flere år lansert flere maskinlæringsbaserte tjenester og verktøy til utviklere som benytter Amazon Web Services (AWS), og under AWS' årlige utviklerkonferanse, Reinvent i begynnelsen av desember, fikk nye ML-tjenester og -verktøy i AWS-skyen på nytt mye oppmerksomhet.

Tre kategorier av ML-brukere

Rolf Koski, teknologidirektør hos Cybercom AWS Business Group, har i 13 år fulgt utviklingen til AWS, og han har de siste årene sett flere og flere utviklere benytte maskinlæring.

– Maskinlæring er ikke lenger et nytt konsept. I de siste tre årene, eller der omkring, har det blitt mer en del av hovedstrømmen, sier Koski, som på grunn av skiftet også selv har blitt mer opptatt av maskinlæring.

Han hevder at det er tre forskjellige typer utviklere som benytter maskinlæring.

– Det er maskinlæringsekspertene, som virkelig forstår ML i dybden, og som har stor innsikt i de forskjellige ML-algoritmene. Deretter er det dataanalytikerne eller ML-spesialistene, som daglig benytter ML, men ikke på samme nivå som ML-ekspertene, og til slutt er det utviklere som ikke har den store kunnskapen om ML, men som benytter én eller flere ML-baserte tjenester som en del av sin løsning, sier Koski.

Den kategoriseringen tilsvarer AWS' oppdeling av ML-baserte tjenester og verktøy, som Swami Sivasubramania, Amazons visepresident for maskinlæring, gikk gjennom i sin hovedtale om maskinlæring under Amazons utviklerkonferanse. Talen var den første av sitt slag.

AWS tilbyr ML-rammeverk til Pytorch, MXNet og Tensorflow, samt infrastruktur som konteinere, GPU-er (graphics processing unit) og FPGA-er (field-programmable gate array) til ML-ekspertene. Amazon Sagemaker-produktene er mot ML-spesialistene, og dessuten er det er en rekke AI-tjenester som kan kalles via et API og benyttes av utviklere uten at de har kjennskap til den underliggende modellen.

Hvordan unngå fordommer?

Det har stadig vært historier om utilsiktede fordommer og diskriminering innebygget i maskinlæringsmodeller. I forrige måned sa en av lederne for etisk kunstig intelligens, Timnit Gebru, opp jobben sin hos Google i protest mot at et forskningsnotat hun hadde utarbeidet sammen med sine kolleger ved AI Ethics Research, ble holdt tilbake av Google.

Forskningsnotatet handlet om hvordan språkmodeller som BERT og GPT kan ha innebygd diskriminering og mannssjåvinisme. Ifølge Googles ledelse var det ikke innholdet av forskningsnotatet som var årsaken til at det i første omgang til ble hold tilbake, men at Gebru ikke hadde fulgt de interne Google-prosedyrene.

Som ikke-hvit kvinne var Gebru med på å skrive et banebrytende forskningsnotat som viste at ansiktsgjenkjennelse var mindre presis til å gjenkjenne kvinner og personer med mørk hud, enn til å gjenkjenne hvite menn.

Et helt ekstremt eksempel på ML-basert diskriminering er Microsofts Tay, som raskt utviklet seg til en holocaustbenektende, mannssjåvinistisk og rasistisk nazisympatisør da bot'en ble sluppet løs på Twitter og løpende lærte av folks samtaler.

Det var 4Chan-/8Chan-inspirerte troll som moret seg med å forderve Tay, men selv i modeller som trenes under kontrollerte forhold, kan det snike seg inn datasett som kan gi en diskriminerende effekt.

Vær kritisk

Vil det være risiko for at vi vil få se flere slike eksempler når maskinlæring uvegerlig blir benyttet av flere utviklere, som ikke nødvendigvis har den store ML-innsikten?

– Et godt karaktertrekk ved enhver profesjonell som bruker en tjeneste, er at vedkommende er kritisk overfor resultatene. Det er ikke annerledes enn normal analytics. Hvis din beregningsmodell gir et uventet resultat, så må du forstå hvor resultatet kom fra. Man skal ikke stole blindt på tallene, sier Koski, som likevel innrømmer at det kan være vanskelig å finne årsaken til et uventet resultat.

– Jo høyere du klatrer opp i abstraksjonsnivå, desto vanskeligere er det å forstå hele årsakssammenhengen og hvordan resultat har framkommet, sier han.

Få klarhet over algoritmen

Én av ML-nyhetene i AWS er Sagemaker Clarify, som ifølge Amazon gir større innblikk i treningsdata og modeller, slik at innebygde fordommer og identifiseres og minimeres, akkurat som produktet kan være med på å forklare en modells avgjørelser.

– Jeg har ikke prøvd det ennå, men det er en tjeneste som kan hjelpe til med å finne ut av om det er forutinntatthet i datasettet, eller om algoritmen skaper forutinntatthet. Ethvert datasett kan være forutinntatt. Dataforutinntatthet finner sted dersom bestemte data er under- eller overrepresentert, og så kan ML-algoritmer bli en selvoppfyllende profeti, sier Koski.

Han nevner et tenkt eksempel hvor det trenes på å finne gode styremedlemmer.

– Det kan fort være en overrepresentasjon av hvite, eldre menn i treningsdataene, og da vil modellen velge hvite, eldre menn som egnede styremedlemmer, sier Koski.

Enklere å få massevis av datakilder

En av de store oppgavene ved maskinlæring er å identifisere og forbedre data som skal inngå i en modell. Her annonserte Amazon en annen nyhet, Data Wrangler, som ifølge Amazon selv «reduserer tiden det tar å aggregere og forberede data til maskinlæring, fra uker til minutter».

Det blir også lett å integrere data fra forskjellige datakilder.

– Ved å benytte Sagemaker, datautvelgelsesverktøyet til Data Wrangler, kan du velge de data du ønsker, fra en mengde forskjellige datakilder, og importere dem med ett enkelt klikk. Sagemaker Data Wrangler inneholder mer enn 300 innebygde datatransformasjoner, slik at du raskt kan normalisere, transformere og kombinere egenskaper uten å skrive noe kode, heter det i Amazons beskrivelse av Data Wrangler.

Koski har ennå ikke sett nærmere på mulighetene med Data Wrangler, men oppfordrer igjen til kritisk sans.

– Det er viktig å holde det gamle uttrykket «Garbage in, garbage out», i hevd. Hvis dataene ikke er gode og i en form som ML kan arbeide med, så blir det ikke noe godt resultat. Hvis du bare bringer inn flere ikke-validerte og ikke-rensede data i en slik situasjon, så forverres situasjonen. God ML starter med å sikre at dataene er av god kvalitet, er merket og tagget korrekt, sier Koski.

Enkle tjenester med kompleksitet

Langt de fleste anvendelser av maskinlæring, som Rolf Koski ser i prosjekter i Norden, er de ferdigbygde AI-tjenestene som AWS tilbyr.

– Det er SaaS-tjenester som alle kan bruke. Det er for eksempel Forecast, Textract og Transcribe. De er komplekse inni, men det er ikke nødvendig for brukerne å forstå de interne mekanismene. Det finnes ikke så mange datavitere, så selv store virksomheter har kanskje én eller to personer som er dedikerte til maskinlæring. Virksomheter og utviklere har derfor nettopp begynt å bygge domenespesifikke implementeringer av ML, avslutter Koski.

Denne artikkelen ble først publisert på danske Version 2.

Powered by Labrador CMS