kunstig intelligens
Studie: «Forgiftning» av KI-modeller truer påliteligheten
Rapport fra selskapet Splunk avslører nye og økende trusseltrender innen KI.
Den pågående KI-revolusjonen har utvidet det digitale trusselbildet på mer enn én måte, og blant de mindre omtalte farene er angrep mot selve KI-modellene. Dette og mer omtales i en ny rapport.
Det Cisco-eide sikkerhets- og analyseselskapet Splunk publiserte nylig den første utgaven av sin nye «Top 50 Cybersecurity Threats»-rapport, som tar for seg nye og økende KI-trusler – i tillegg til en rekke andre farer.
Når det gjelder KI-relaterte trusler, peker Splunk på at såkalte «backdoor injection»-angrep, eller bakdørinjeksjon på norsk, nå har blitt så utbredt at det er på høy tid å gi fenomenet langt mer oppmerksomhet
Alvorlig trussel
– Bakdørinjeksjon har seilt opp som en alvorlig KI-trussel, hvor angripere implanterer skjulte triggere inni maskinlæringsmodeller for å få dem til å oppføre seg ondsinnet under spesifikke omstendigheter, skriver Splunk.
Denne angrepstypen innebærer altså å manipulere dataene som KI-modellene trenes på ved å skjule ondsinnede instruksjoner i tilsynelatende harmløse data.
Disse «forgiftede» dataene kan deretter utløse ondsinnet adferd basert på de skjulte instruksjonene, noe som skjer via bestemte «triggere», som for eksempel når brukeren av KI-tjenesten benytter et bestemt ord, setning eller forespørsel.
Som sikkerhetsselskapet peker på, kan svakheter i leverandørkjeden, delte datasett og åpne kildekodemodeller øke mulighetene for denne type angrep.
Krever kun 250 dokumenter
Det var lenge antatt at bakdørinjeksjonsangrep krevde store mengder ondsinnet data, men det viser seg at dette slettes ikke er tilfelle. Splunk viser til en omfattende studie fra oktober i fjor som dro den noe urovekkende konklusjonen at et svært begrenset antall ondsinnede dokumenter er tilstrekkelig, uavhengig av størrelsen på datasettene.
– Vi finner at 250 forgiftede dokumenter kompromitterer modellene i tilsvarende grad på tvers av alle modell- og datasettstørrelser, til tross for at de største modellene trenes på mer enn 20 ganger så mye rent data, skrev forskerne. I eksperimentene testet forskerne modeller på mellom 600 millioner parametere helt opp til 13 milliarder.
En beslektet trussel som også omtales i Splunk-rapporten er «modellforgiftning» (model poisoning), som også innebærer å injisere ondsinnede og/eller «partiske» data for å subtilt endre måten modellen oppfører seg på og måten den lærer på.
Et farlig utfall av modellforgiftning er desinformasjon og mangel på tillit til KI-modellene, peker Splunk på. Også her viser forskerne til en studie som avslørte at forgiftning av kun 0,001 prosent av et offentlig datasett var nok til å svekke en medisinsk KI-modell nok til å spre desinformasjon – som altså kan være svært skadelig i den sammenhengen.
Kan forverre «modellkollaps»
Som Digi tidligere har rapportert, har forskere allerede pekt på at stadig mer data på internett er KI-generert. Med tanke på at KI-modellene i stor grad trenes på data som er hentet nettopp fra nettet, kan den fremtidige påliteligheten og kvaliteten til KI-modellene dermed trues, med fare for det analysebyrået Gartner kaller «modellkollaps».
Bevisst manipulering av «forgiftning» av treningsdata som Splunk omtaler, kan dermed øke faren for modellkollaps ytterligere.
En rekke andre aktører har omtalt modellforgiftningsfenomenet, blant andre Cloudflare. Selskapet peker på at fenomenet kan permanent endre en modells utdata til fordel for angriperen og føre til at en modell produserer propaganda eller hatefulle ytringer, gir unøyaktige anbefalinger, oppgir falske data eller fremmer nedlastinger av skadelig programvare.