kunstig intelligens
Gartner mener dataanalyse vil gjøres av folk flest. Ekspert: – Det er slik du ender opp med rasistiske algoritmer
Ideen om at avansert dataanalyse (data analytics) skal overlates til såkalte «citizen data scientists» ligger ennå langt inn i fremtiden, mener sjefen for AI og stordata hos Hitachi Vantara.
I 2020 vil 40 prosent av data science-oppgavene være automatiserte – noe som vil innebære at store deler av analysearbeidet langt på vei vil bli overtatt av såkalte «citizen data scientists». Dette er i hvert fall det Gartner forutsier.
Allerede neste år vil citizen data scientist overgå data scientist målt på mengden av avansert analyse som de produserer, mener analysehuset.
Men Wael Elrifai, som er VP for Solution Engineering for Pentaho, Hitachi Vantaras big data-plattform, er skeptisk.
– Jeg er tilhenger av data-demokratisering. Ambisjonen rundt citizen data scientist er god, og det er fint å forberede seg på dette. Men ideen om at du bare overlater arbeidet til dem, er skremmende. Det er slik du ender opp med å få kjørt ut rasistiske algoritmer, sier han.
– Det er en grunn til at folk tar ph.d-er for å gjøre disse sakene. Du vil ikke ha en «citizen civil engineer» til å bygge et hus – og hvorfor skulle dette være annerledes? spør Wael Elrifai.
Dritt inn...
Gartner definerer en citizen data scientist som en person som skaper avanserte analyse-modeller, mens den primære jobbfunksjonen ligger utenfor statistikk- og analyse-feltet.
Trenden er blant annet drevet av stadig flere verktøy som automatiserer data science-arbeidet. Men AutoML-verktøy er ikke klare til å overta, mener Wael Elrifai.
– Vi er ikke der ennå. AutoML er en tilgang til CASH-problemet – Combined Algorithm Selection & Hyperparameter opmization. Det bruker ML til å forutse hvilken algoritme og hvilke hyperparametere som skal brukes, forklarer han.
– Dette er på ingen måte perfekt. Det kan gjøre grunnleggende ting, men du kan ikke bare ta og sette det i produksjon; du er nødt til å sjekke for skjevheter (bias) og så videre. Poenget er at hvis du legger inn dritt, får du dritt ut, understreker Wael Elrifai.
AutoML fanger ikke bias
Wael Elrifai er blant annet redd for at utvalgsfeil (selection bias) vil være et stort problem, hvis andre yrkesgrupper brukes til å gjennomføre avansert dataanalyse.
– La oss si at vi gjerne vil forutsi hvor lang fengselsstraff vi bør gi folk, og du bruker historiske data til det. Da kan du ende opp med et system som har kjønnsbias og rasebias, forteller han. – Det er ikke fordi AutoML-systemet ikke virker. Det er fordi personen som gjør dette ikke forstår at når man bygger et system på data med bias, ender man opp med et resultat med skjevheter.
Som førerkortet
Og i den nære fremtiden vil ikke løsningen være å la datamaskinen overta problemet med bias også, mener Wael Elrifai. Det handler om opplæring på en bred front.
– For 130 år siden visste ingen hvordan man kjører en bil. I dag vet nesten alle det. I dag er det ikke engang fem prosent av befolkningen som vet hvordan man håndterer data, men om 20 år kan det hende at alle gjør det, sier Wael Elrifai, og påpeker at den samme utviklingen er i ferd med å skje innen programmering.
– Dette bunner i en grunnleggende forståelse av data science-konsepter som utvalgsfeil og lignende i denne kategorien. Vi kommer til å komme dit – akkurat slik som vi øker antallet folk som kan programmere, sier Wael Elrifai.
– I den kommende fasen dreier det seg om å gjøre folk kjente med data. I fasen etter dette kan det være at vi kan få datamaskinen til å oppdage skjevheter i dataene. Men vi er ikke der ennå.
Artikkelen har tidligere vært publisert på Datatech. Datatech tilhører Teknologiens Mediehus.