kunstig intelligens

Google-forskere: Stort behov for bedre dokumentasjon av ML-modeller

En standard for dokumentasjon av maskinlærings-modeller er kritisk for å unngå misbruk, mener forskere hos Google.

Illustrasjon.
Illustrasjon.

I dag finnes det ingen standarder for hvordan utviklere dokumenterer de maskinlærings-modellene de trener og skaper. Hva var det opprinnelige formålet til modellen? Hvilke begrensninger har den? Disse spørsmålene blir vanligvis ikke besvart når modellene blir frigitt til bruk.

Om forskningen

Artikkelen 'Model Cards for Model Reporting' er skrevet av en rekke forskere ved Google.

Forfatterne er Margaret Mitchell, Simone Wu, Andrew Zaldivar, Parker Barnes, Lucy Vasserman, Ben Hutchinson, Elena Spitzer, Inioluwa Deborah Raji og Timnit Gebru.

Artikkelen blir presentert i slutten av januar på Fairness, Accountability and Transparency (ACM FAT) i Atlanta, USA.

Og det er et problem, mener en gruppe forskere fra Google. Spesielt når modellene brukes på områder der de kan ha alvorlig innvirkning på personers liv – som i helsesektoren samt i jobbsammenheng og innen utdannelse og rettsvesen.

Eksemplene på systematisk bias, eller avvik, i algoritmer har etter hvert blitt tallrike, skriver de ni forskerne i en artikkel som i slutten av denne måneden blir presentert på konferansen Fairness, Accountability and Transparency (ACM FAT*) i Atlanta, USA.

«However, these systematic errors were only exposed after models were put into use, and negatively affected users reported their experiences.»

MIT-studenten Joy Buolamwini fant for eksempel ut at kommersielle løsninger til ansiktsgjenkjenning klarte seg betydelig dårligere på mørke kvinner enn på hvite menn. Men i dokumentasjonen for modellene om ytelsene deres og use cases finnes det svært lite informasjon om denne typen svakheter, bemerker forskerne.

«This highlights the need to have detailed documentation accompanying trained machine learning models, including metrics that capture bias, fairness and inclusion considerations,» heter det i konklusjonen.

Ikke bruk denne modellen ...

Løsningen som Google-forskerne foreslår, er en dokumentasjonsstandard som de har gitt navnet Model Cards – én til to siders informasjon om kritiske aspekter av ML-modellen. Informasjonen skal kunne brukes av både brukere og utviklere, og av lovgivere og personer som måtte være påvirket av en ML-modell og gjerne vil forstå den bedre.

«The proposal of “Model Cards” specifically aims to standardize ethical practice and reporting – allowing stakeholders to compare candidate models for deployment across not only traditional evaluation metrics but also along the axes of ethical, inclusive, and fair considerations,» skriver forskerne.

«This goes further than current solutions to aid stakeholders in different contexts. For example, to aid policy makers and regulators on questions to ask of a model, and known benchmarks around the suitability of a model in a given setting.»

Modellkortet som forskerne foreslår, skal først og fremst inneholde grunnleggende informasjon om modellen som for eksempel dato og utviklere. Dette punktet bør også inneholde informasjon om treningsalgoritmer og parametere.

Under punktet Intended Use anføres det hvilke brukere og use cases utviklerene så for seg under utvikling, samt hvilke uses cases man ikke anbefaler. Sistnevnte element sammenligner forskerne med advarsler på leketøy og matvarer. Et slikt varsel på en ML-modell kunne for eksempel være «Bruk bare modellen på bilder i svart-hvitt.»

Ytelse på tvers av kjønn og aldersgrupper

Under punktet Factors skal utviklere notere hvordan modellen klarer seg på tvers av for eksempel befolkningsgrupper og miljøer. En analyse av et bilde kan for eksempel være påvirket av maskinvaren i kameraet, lysforhold og – ikke minst – kjønn, alder og rase til personen på bildet.

Modellkortet skal dessuten inneholde punktet Metrics, som skal opplyse om de parametere som modellen har blitt bedømt etter og hvorfor. Forskerne bemerker at dette vil variere mellom ulike modelltyper – på samme måte som vurderingen av hvilke parametere som er viktige, vil avhenge av formålet og konteksten:

Ett av to eksempler på hvordan forskerne ser for seg modellkortet. Denne handler om en modell som skal identifisere smil. Modellen er trent på CelebA-datasettet, som består av bilder av kjente mennesker. Illustrasjon: Mitchell et al.
Ett av to eksempler på hvordan forskerne ser for seg modellkortet. Denne handler om en modell som skal identifisere smil. Modellen er trent på CelebA-datasettet, som består av bilder av kjente mennesker.

«For example, in a surveillance scenario, surveillors may value a low false negative rate (or the rate at which the surveillance system fails to detect a person or an object when it should have). On the other hand, those being surveilled may value a low false positive rate (or the rate at which the surveillance system detects a person or an object when it should not have). We recommend listing all values and providing context about which were prioritized during development and why.»

I forlengelsen av de to punktene vil forskergruppen at hver modell utstyres med en kvantitativ analyse som viser hvordan modellen deretter leverer på de forskjellige parameterne for hver gruppe.

Hvis algoritmen skal gjette om en person smiler eller ikke – se eksempel lengre nede – skal modellkortet vise hvor godt den klarer seg på tvers av kjønn og aldersgrupper.

Kan ikke stå alene

For å gjøre det mulig å verifisere modellen, foreslår forskergruppen at man deler datasettet som modellen er evaluert med. På samme måte vil modellkortet ideelt sett inneholde så mye informasjon om treningsdata som det lar seg gjøre.

Og til slutt må utviklere skrive opp hvilke etiske overveielser som følger med modellen, og hvilke forbehold de vil ta. Dette kan for eksempel handle om hvorvidt modellen bruker følsomme persondata, samt risikoer ved å bruke modellen.

Selv om modellkortet kan gi økt transparens innenfor maskinlæringssystemer, ser ikke forskerne det som sannsynlig at verktøyet blir gjort til en standard i løpet av nærmeste fremtid.

«It is therefore important to consider model cards as one transparency tool among many, which could include, for example, algorithmic auditing by third-parties (both quantitative and qualitative), «adversarial testing» by technical and non-technical analysts, and more inclusive user feedback mechanisms,» skriver forskerne.

Artikkelen har tidligere vært publisert på Datatech. Datatech tilhører Teknologiens Mediehus.

Powered by Labrador CMS