kunstig intelligens

Microsoft undersøkte sikkerheten til 100 KI-produkter – dette er resultatet

Selskapet undersøkte 100 av sine egne KI-produkter.

Microsoft har gått hardt til verks på sine egne KI-produkter og har kommet frem til at KI-sikkerhet er et arbeid som aldri vil ta slutt.
Microsoft har gått hardt til verks på sine egne KI-produkter og har kommet frem til at KI-sikkerhet er et arbeid som aldri vil ta slutt.

Kunstig intelligens (KI) opplever en rivende utvikling, og det store potensialet for skadevirkninger har gjort risikovurderinger til en høy prioritet for de fleste selskaper som jobber med teknologien.

Dette gjelder ikke minst for Microsoft, som nå har publisert en ny rapport om sine egne KI-produkter – og den er faktisk ganske nedslående.

Rapporten tar for seg funnene til Microsofts såkalte «red teaming»-prosess, som innebærer å bruke bedriftens egne ingeniører til å teste og «angripe» sine egne produkter for å evaluere sikkerheten.

Aldri helt trygg

Rapporten omfatter hele 100 av selskapets egne generative KI-produkter, og en av lærdommene Microsoft gjorde seg, er at arbeidet med å sikre KI-systemer aldri vil ta slutt – som altså betyr at KI-teknologien ifølge Microsoft aldri vil bli helt trygg.

I rapporten peker Microsoft på at generative KI-systemer gjør eksisterende sikkerhetstrusler mer alvorlige, i tillegg til å introdusere nye trusler.

En av de nye truslene som KI har introdusert, er såkalt «prompt injection»-angrep, som innebærer å manipulere – eller «jailbreake» – KI-modeller med ondsinnede instruksjoner i den hensikt å produsere skadelig eller utilsiktet innhold.

Selskapet fant at slike angrep er relativt enkle å utføre.

I en av testene brukte Microsoft en slik type angrep for å lure en VLM-modell (vision language model) til å forklare hvordan man kan gjennomføre identitetstyveri, til tross for at modellen i utgangspunktet ikke skal kunne adlyde denne typen instrukser.

– Etter å ha testet en rekke teknikker, fant vi at bildegjenkjenning var mye mer sårbar for «jailbreak» enn tekstinstrukser. Spesielt nektet modellen vanligvis å generere ulovlig innhold når den ble bedt direkte via tekstinstruksen, men den fulgte ofte instruksjoner når ondsinnede instruksjoner ble lagt over bildet, skriver Microsoft.

– Sikkerhetsarbeid krever menneskelig innblanding

I en annen test av sine egne produkter fant Microsoft en metode for å benytte en KI-språkmodell til å automatisere svindel. Dette ble gjort ved å koble språkmodellen til et tekst-til-tale-system og et tale-til-tekst-system, noe som gjorde det mulig for modellen å ha en naturlig samtale med offeret.

– Dette «proof-of-concept»-forsøket viste hvordan språkmodeller med utilstrekkelige sikkerhetsbarrierer kan utnyttes til å overbevise og svindle folk, skriver Microsoft.

På bakgrunn av funnene sine sier Microsoft at «red teaming», altså det å knekke KI-systemer for å avdekke svakheter, krever menneskelig deltakelse og ikke er velegnet for automatisering – slik mange andre KI-oppgaver er.

Microsoft sier at menneskelig involvering er avgjørende blant annet for å forstå kulturelle og politiske kontekster i vurderingen av språkmodeller.

Det er også viktig på grunn av behovet for emosjonell intelligens i visse sammenhenger – for eksempel når brukere som opplever mentale problemer, benytter KI-modeller. I slike sammenhenger er det en fare for at KI-modellene kan gjøre problemene verre, påpeker Microsoft.

Powered by Labrador CMS