kunstig intelligens

Så enkelt ble alle KI-nettleserne lurt til å utlevere sensitive data

Alle de store er sårbare for farlig angrepsmetode, konkluderer sikkerhetsforskere.

KI-nettlesere har flere farlige sårbarheter, har forskere nå på nytt demonstrert. Skjermbildet er hentet fra Chat GPT Atlas.
KI-nettlesere har flere farlige sårbarheter, har forskere nå på nytt demonstrert. Skjermbildet er hentet fra Chat GPT Atlas.

En bieffekt av at KI-systemer blir stadig mer autonome og selvstyrte – ofte kalt «agentiske» – er at dette også gjør det enklere å utføre ondsinnede handlinger som tidligere ville vært mer kompliserte. Nå foreligger det ny forskning som på nytt bekrefter denne faren.

Sikkerhetsforskere har nå demonstrert hvor enkelt det er å narre de nye KI-nettleserne, som altså er designet rundt autonomi, til å ignorere egne sikkerhetsmekanismer for å utføre handlinger de ikke er ment å utføre.

Blant andre nettstedet Security Week rapporterte om saken.

«Falsk virkelighet» utløser stor sårbarhet

Forskere hos sikkerhetsselskapet LayerX gjennomførte et eksperiment som innebar å endre KI-nettlesernes «virkelighetsoppfatning» på en slik måte at det ble mulig å bruke nettleserne til å utføre tilnærmet enhver kommando – uavhengig av sikkerhetsgjerdene som nettleserne har.

Som forskerne påpeker opererer KI-systemene normalt under den forutsetningen at konteksten hele tiden er reell, som er selve grunnlaget for at adferden tilpasses de sikkerhetsmessige begrensingene. Dette kan imidlertid omgås ved å simpelthen «mate» KI-systemet med en alternativ, falsk virkelighet.

– Men hvis vi kan lure KI-en til å endre konteksten til en fantasiverden – der reglene er oppdiktede og alt er tillatt – kan den oppføre seg som om handlingene dens ikke får konsekvenser i den virkelige verden, skriver forskerne og fortsetter:

– Da kan vi få KI-en til å fortelle oss hvordan vi kan gjøre skadelige ting, eller til og med utføre dem på eget initiativ, i stedet for å følge de innebygde sikkerhetsmekanismene sine.

Kompromitterte brukerlegitimasjon

Som et konseptbevis gjennomførte LayerX-forskerne et eksperiment som innebar å lage en nettside med et puslespill, med den regelen at spillerne ble belønnet for å gi feil svar i stedet for det riktige.

Fem forskjellige KI-nettlesere ble bedt om å løse puslespillet, og etter at agentene forsto reglene og lærte at «feil» handlinger var akseptable, var de ikke lenger bundet av den virkeligheten som ligger til grunn for sikkerhetsmekanismene. Dermed ble en svært farlig sårbarhet åpnet opp.

– Da de fikk den siste oppgaven i puslespillet – å kompromittere brukerlegitimasjon – klarte ingen av de seks agentene å gjenkjenne at dette var i strid med de innebygde sikkerhetsmekanismene sine, skriver forskerne.

Denne sårbarheten kan relativt enkelt utnyttes ved å legge inn lignende puslespill på ondsinnede nettsider, for eksempel med omdirigeringer til andre nettsider med sensitivt innhold som kan kompromitteres ved hjelp av nettleseren autonome egenskaper.

Flere sårbarheter

De seks agentene som ble testet var Open AIs Atlas-nettleser, Perplexitys Comet, Fellou, Genspark Browser, Sigma og Anthropics nettlesertillegg til Chrome. LayerX informerte samtlige om funnene, men så langt er det kun Open AI som har respondert og fikset sårbarheten, ifølge sikkerhetsselskapet.

Andre forskere fant for øvrig en annen sårbarhet i KI-nettlesere. Digital Trends meldte nylig om en studie fra University of Washington fra april i år som viser at KI-nettlesere kan stjele data på tvers av nettsider.

Nærmere bestemt fant forskerne at nettleserne ved hjelp av «prompt injection»-angrep relativt enkelt kan omgå den såkalte «same origin»-regelen – som er ment å forhindre nettsider med ulik opprinnelse fra å samhandle med hverandre via netttleseren.

– Vil aldri bli helt løst

Dette kan altså legge til rette for at angripere kan hente ut data fra sensitive nettsider. Forskerne delte funnene med Anthropic, Brave, Firefox, Google, Open AI, Microsoft og Perplexity, men kun Brave, Google og Microsoft hadde respondert da arbeidet ble publisert.

Disse sårbarhetene er for øvrig noe KI-selskapene selv har innrømmet. Open AI tilstod for eksempel at en av de største truslene de opplever med Atlas-nettleseren sin er nettopp «prompt injection»-angrep, hvor agenten lures til å ignorere regler og sikkerhetsmekanismer.

– Vi forventer at ondsinnede aktører vil fortsette å tilpasse seg. «Prompt injection», akkurat som svindel og sosial manipulering, vil trolig aldri bli helt «løst», skrev Open AI.

Powered by Labrador CMS