kunstig intelligens

SHAP-analyse: Nytt verktøy for maskinlæring gjør det mulig å åpne den svarte boksen

Data scientist mener at SHAP sørger for å vi ikke må velge mellom transparens og presisjon.

Illustrasjon.
Illustrasjon.

Et nytt verktøy for jobben med komplekse maskinlærings-modeller gjør det mulig å åpne den svarte boksen, og forklare hvordan modellen kom fram til en bestemt forutsigelse.

SHAP-verktøyet – SHapley Additive exPlanation – åpner for at bedrifter ikke trenger å ofre presisjon for å kunne forsvare algoritmens forutsigelse.

– Vi ser at de minst presise modellene er enklest å tyde, forklarte Erlin Gulbenkoglu, som er AI-spesialist hos den finske AI-bedriften Silo.ai, på konferansen European Data Ethics Forum 2018, som ble arrangert i København i slutten av september.

– Mer komplekse modeller gir mer nøyaktige resultater, men resultatet blir vanskelig å tyde. I dag betyr presisjon penger, og derfor leter folk naturligvis etter de mest nøyaktige modellene, sier hun.

Med en lineær regresjon eller et beslutningstre er det ganske enkelt å gjøre rede for hvorfor en kunde for eksempel havner i en bestemt kategori. Med et komplekst nevralt nett blir det raskt umulig å gjennomskue, selv for konstruktøren bak modellen. Og det er et problem, poengterer Erlin Gulbenkoglu.

GDPR utforder black box-modeller

Black box-modeller til analyse av persondata blir direkte utfordret av GDPR’s artikel 13, mener Erlin Gulbenkoglu.

Her kommer det fram at en person skal ha tilgang til «meaningful information about the logic involved», hvis data behandles for å gjennomføre profilering eller automatiske beslutninger.

Transparens er også et sentralt krav i de fleste settene med retningslinjer og prinsipper for dataetikk. Den danske tenketanken DataEthics skriver for eksempel at databehandling i en algoritme skal kunne forklares.

– Vi er nødt til å kunne forklare logikken bak, sier Erlin Gulbenkoglu.

– Den ene delen av dette er å forklare hvordan AI-modellen fungerer. Hvor mange lag, hvor mange noder, hvordan er vektingen regnet ut og så videre. Men det er ikke det som er interessant for mange de fleste. Poenget er i stedet at man skal kunne forklare årsaker til en forutsigelse.

Den utfordringen kan løses med rammeverket SHAP, som er utviklet av to forskere fra University of Washington – Scott M. Lundberg og Su-In Lee – og presentert i to forskningsartikler (her og her)

Individuell forutsigelse

Ideen bak SHAP kommer fra cooperative game theory, hvor Shapley Value blir brukt til å regne ut hvor mye én enkelt spiller på et lag har bidratt i en kamp.

I denne sammenhengen er utfallet av kampen ML-modellens output, og spillerne er alle de ulike faktorene som gir det utfallet. «Innsatsen deres i kampen» reflekterer på den måten hvor avgjørende en faktor er for den endelige forutsigelsen.

Et av de viktigste punktene er her at SHAP-analysen utelukkende beskriver én enkelt forutsigelse fra modellen – og ikke modellen i sin helhet. Det innebærer at SHAP-analysen ser forskjellig ut for hver person som analysen omfatter.

Erlin Gulbenkoglu bruker som eksempel et datasett fra dataspillet League of Legends, hvor målet er å forutsi om en gitt spiller ender opp med å vinne kampen. I en analyse bidrar variabelen «Gull tjent per minutt» sterkt til at modellen tror spilleren vinner kampen. For en annen spiller bidrar variabelen negativt – fordi spilleren tjener mye mindre gull.

En spesifikk spillers sannsynlighet for å vinne. De røde faktorene har positive SHAP-verdier og øker sannsynligheten for at spilleren vinner. De blå har negative SHAP-verdier, og teller dermed negativt på spillerens vinnersjanser. Illustrasjon: Lundberg
En spesifikk spillers sannsynlighet for å vinne. De røde faktorene har positive SHAP-verdier og øker sannsynligheten for at spilleren vinner. De blå har negative SHAP-verdier, og teller dermed negativt på spillerens vinnersjanser.

På et generelt nivå kan man ikke beskrive betydningen av «Gull tjent per minutt»-variabelen på grunn av komplekse og ikke lineære interaksjoner med andre variabler (se graf). Men på et individuelt nivå er variablenes betydning likevel konstant – og kan med SHAP derfor beskrives like klart som en lineær regresjon.

SHAP-verdien av «Gull tjent per minutt» er avhengig av andre faktorer - som for eksempel «Gull brukt per minutt». Illustrasjon: Lundberg
SHAP-verdien av «Gull tjent per minutt» er avhengig av andre faktorer - som for eksempel «Gull brukt per minutt».

Et annet eksempel kommer fra data scientist Gabriel Tseng i en blogg.

Hvis en modell skal forutsi om en person er interessert i dataspill, kan den for eksempel ende med å konkludere med at alder overordnet sett er den mest avgjørende variabelen. Men for en 50-årig spillanmelder er jobbtittel mye mer avgjørende enn alderen. Den 50-årige vil dermed ha en annen SHAP-analyse enn en 14-årig gutt.

SHAP i praksis

I praksis kan SHAP-analysen implementeres side om side med ML-modellen, slik at den personen som skal bruke forutsigelsen kan få en klar forestilling om hva som har vært avgjørende for resultatet.

Dette har bedriften Civis Analytics gjort hos en kunde, skriver bedriftens Senior Applied Data Scientist Peter Cooman i en blogg.

«Until recently, we always had to choose between an accurate model that was hard to interpret, or a simple model that was easy to explain but sacrificed some accuracy» skriver han.

«With SHAP values, we are finally able to get both!»

Civis Analytics lagde en løsning for kundefrafall (churn-løsning) for en kunde med en kompleks XGBoost-modell og implementerte SHAP, slik at de individuelle resultatene kunne tydes. Og det er avgjørende, skriver Cooman.

«Traditional feature importance algorithms will tell us which features are most important across the entire population, but this one-size-fits-all approach doesn’t always apply to each individual customer. A factor that is an important driver for one customer may be a non-factor for another. By looking only at the global trends, these individual variations can get lost, with only the most common denominators remaining.»

Peter Cooman peker på at SHAP ikke forteller hva du skal gjøre med den informasjonen analysen gir. Hvis en modell forutsier at en kunde faller fra (churner), og primært baserer det på få besøk fra salgspersonale, er du ikke sikker på å løse noe med flere salgsbesøk. Men Cooman erkjenner også at det er en fundamental begrensning ved data science, og ikke ved SHAP i seg selv.

«We think there’s a lot of promise in SHAP values,» skriver Peter Cooman.

«Instead of having to choose between accuracy and interpretability, we finally have a tool that lets us push the envelope in terms of model complexity and accuracy, while still allowing us to derive intuitive explanations for each individual prediction.»

SHAP har blitt lagt til i XGBoost-biblioteket i Python.

Artikkelen har tidligere vært publisert på Datatech. Datatech tilhører Teknologiens Mediehus.

Powered by Labrador CMS