maskinlæring
– Et stort gjennombrudd innen personvernbevarende beregninger
En ny versjon av et eksisterende maskinlæringsrammeverk gjør det mulig å trene maskinlæringsmodeller direkte på krypterte data.
Selskapet Zama kunngjorde nylig en nyhet i maskinlæringsrammeverket Concrete ML som mange skal ha ventet på, nemlig muligheten for å trene maskinlæringsmodeller på krypterte data.
Mange sensitive data er lagret kryptert, skirver Zama skriver i et blogginnlegg. For at maskinlæring virkelig skal kunne hente ut verdien i disse dataene, har det fram til nå vært nødvendig å dekryptere dataene, noe ifølge Zama kan være en krevende prosess.
I Concrete ML 1.4 er denne dekrypteringen imidlertid ikke nødvendig. Rammeverket har nemlig en ny funksjonalitet for logistisk regresjon som gjør det mulig å trene maskinlæringsmodeller direkte på krypterte data. Dataene vil dermed hele tiden være sikret mot innsyn.
– Stort gjennombrudd
Tjerand Silde er forskningsgruppeleder ved NTNU Applied Cryptology Lab. Han mener dette et stort gjennombrudd innen personvernbevarende beregninger.
– Det vil si at man aldri trenger å dele sensitive data i klartekst med de som har utviklet maskinlæringsalgoritmene, noe som fører til at man for
eksempel kan utvikle algoritmer til å detektere ulike sykdommer, uten å måtte dele pasientdata, skriver Silde i en e-post til Digi.
Homomorfisk kryptering
Han forklarer at det er homomorfisk kryptering som gjør det mulig å trene modeller på krypterte data.
– Homomorfisk kryptering fungerer slik at man kan gjøre addisjoner og multiplikasjoner på ciffertekster (kryptert data) slik at den resulterende cifferteksten blir en kryptering av addisjonen eller multiplikasjonen, uten at man vet hvilke data som var kryptert, skriver Silde.
Han forklarer at dersom man har en algoritme for å trene en maskinlæringsmodell, kan man kryptere dataene man ønsker å trene modellen på – og ta cifferteksten som input til algoritmen, istedenfor selve dataene.
– Algoritmen må tilpasses litt, men i praksis gjør den akkurat den samme beregningen som om dataene ikke var kryptert. Så kan man dekryptere sluttresultatet og få ut den modellen man skulle lage.
Silde legger til at homomorfisk kryptering har en kostnad fordi ciffertekster er mye større enn ukrypterte data og beregninger på ciffertekster tar mye lengre tid enn beregninger på ukrypterte data.
– Men forskning og utvikling over mange år har gjort dette praktisk i dag, forteller han.