analyse
Dette vil Meta med dine data
Meta påberoper seg berettiget interesse og mener at deres behov for dine data er så viktig at du må aktivt reservere deg heller enn å melde deg frivillig.
Meta har gitt beskjed om at man innen 26. juni må reservere seg dersom man ikke ønsker at de trener sin KI-løsning på dine data, og det har i Norge den siste tiden kokt av folk som vil reservere seg.
Og reservere deg gjør du slik.
Hva Meta ønsker, og hvorfor, har imidlertid vært litt mer uklart. Her har vi derfor forsøkt å gi innsikt i nettopp det.
Dette har Meta trent sin KI på hittil
Meta har allerede sin Llama 3-modell, en stor språkmodell som i hovedsak er trent på offentlig tilgjengelig informasjon. I dette inngår blant annet:
- Offentlig tilgjengelige nettsider
- Tekst fra offentlig tilgjengelige bøker
- Offentlig tilgjengelige vitenskapelige artikler og databaser
- Offentlig tilgjengelige kodesamlinger, som for eksempel Git Hub
Disse dataene er så kjørt gjennom ulike filtre, for å sikre at ting som er uønsket tas bort før språkmodellen trenes på det. Dette kan fjerne for eksempel duplikater, seksuelt eksplisitt materiale, og tekst fra tvilsomme enkeltkilder. I tillegg har Meta brukt sin tidligere versjon, Llama 2, for å identifisere og velge ut data som er av høy nok kvalitet til å inngå i treningen av Llama 3.
Oppdager du dine data fra slike kilder, kan du kreve at Meta fjerner dem, men terskelen er høy og de legger bevisbyrden på deg.
Dette ønsker Meta å trene sin KI på fremover
I Llama 3 har Meta ikke benyttet noe data fra Facebook, Instagram, Whats App eller andre av de Meta-eide plattformene.
Dette er imidlertid noe de ønsker å endre på, og fra 26. juni 2024 vil de også benytte følgende:
- Egne innlegg, fra europeiske brukere som ikke har reservert seg
- Svar på andres innlegg, fra europeiske brukere som ikke har reservert seg
- Egne innlegg, fra brukere fra resten av verden
- Svar på andres innlegg, fra brukere fra resten av verden
- Bilder og annet multimedia-innhold, fra europeiske brukere som ikke har reservert seg
- Bilder og annet multimedia-innhold, fra brukere fra resten av verden
- I fremtiden ønsker de også å benytte brukernes interaksjon med KI-løsningen som basis for trening, enten det er Metas egen KI eller andre bedrifter som benytter den samme løsningen
Takket være GDPR og annen EU-lovgivning kan brukere i Europa reservere seg mot slik bruk av sine innlegg og bilder. Men dette gjelder kun europeiske brukere.
I USA, for eksempel, er det fritt frem for Meta.
Det er uansett viktig å merke seg at reservasjonen kun gjelder egne innlegg, bilder og så videre, selv for europeiske brukere.
Om du er avbildet eller nevnt i innlegg eller bilder som andre har postet, hjelper det ikke om du har reservert deg.
– Respekterer alle
Meta skriver i et blogginnlegg at de respekterer alle reservasjoner i Europa:
– Hvis et protestskjema sendes inn før treningen begynner, vil ikke den personens data bli brukt til å trene disse modellene, verken i den nåværende treningsrunden eller i fremtiden.
Dette har hittil være noe man har antatt og sett tydelige tegn på, men som ikke har vært offisielt fra Metas side før nå.
Dette trener Meta IKKE sin KI på
Foruten filtreringen for å ta bort uønsket materiale – som tidligere nevnt – trener Meta eksplisitt ikke sin KI på privat eller konfidensiell informasjon. Det vil si at de ikke benytter seg av ting som:
- Private meldinger
- Innlegg i skjulte eller private grupper
- Innhold i kontoer som tilhører europeere under 18 år
- Innhold i europeiske kontoer som tilhører folk som har reservert seg
Hvorfor vil Meta gjøre dette?
Meta selv skriver at målet er å «... bygge nyttige funksjoner basert på informasjon som personer over 18 år i Europa har valgt å dele offentlig på Metas produkter og tjenester, for eksempel offentlige innlegg, offentlige kommentarer eller offentlige bilder og deres bildetekster.»
Videre skriver de at «... modeller kan trenes på folks offentlig delte innlegg, men det er ikke en database med hver persons informasjon, og den er heller ikke laget for å identifisere noen».
Modellene bygges ved å analysere folks informasjon med den hensikt å identifisere mønstre, som for eksempel å forstå setninger eller lokale referanser.
Berettiget interesse
GDPR åpner for å benytte data for bedrifter eller offentlige etater som har det som kalles en «berettiget interesse» for de aktuelle dataene.
Det er dette grunnlaget Meta påberoper seg for å trene sin KI-løsning på brukerdata fra sine plattformer, og for å gjøre dette til noe man må reservere seg mot dersom man ikke ønsker det.
Det er imidlertid begrenset hva som kan defineres som «berettiget interesse», og i hvilke tilfeller og sammenhenger man kan gjøre det. Datatilsynet oppsummerer det slik:
«En virksomhet kan behandle personopplysninger dersom det er nødvendig for å vareta en berettiget interesse som veier tyngre enn hensynet til den enkeltes personvern.»
For eksempel er det et krav at slik bruk må foregå på måter som folk med rimelighet kan forvente, og som har minimal innvirkning på personvernet, eller der det er en overbevisende begrunnelse for behandlingen.
Hvis en bedrift eller myndighet påberoper seg «berettiget interesse», påtar de seg samtidig et utvidet ansvar for å vurdere og beskytte folks rettigheter og interesser med hensyn til de dataene som benyttes, påpeker ICO, Storbritannias Information Commissioner's Office.
Kort fortalt, for å påberope seg «berettiget interesse» må man:
- Identifisere og oppgi interessen
- Vise at behandlingen er nødvendig for å oppnå formålet
- Vurdere behov og behandling av dataene mot individets interesser, rettigheter og friheter
Det stilles også krav om at behandlingen av slike data må være nødvendig. Om man med rimelighet kan oppnå samme resultat på en annen og mindre inngripende måte, vil ikke legitime interesser være gjeldende.
Datatilsynet, på sin side, mener at Meta burde gjort denne KI-treningen til noe man må aktivt samtykke til – såkalt «opt-in» – heller enn såkalt «opt-out», det vil si reservere seg.
Datatilsynets direktør Line Coll har tidligere uttalt at Meta har rykte på seg for å være «verst i klassen» etter at det viste seg at de alene stod for nesten 60 prosent av de 70 største GDPR-bøtene som er gitt.