kunstig intelligens
KI-selskapene skraper enorme mengder data fra nettet. Nå har det kommet en kreativ løsning
Selskapet kom opp med en smart plan for å stanse «AI crawler»-fenomenet.
Den pågående KI-revolusjonen har mange fordeler, men de fleste begynner nå også å bli kjent med flere av baksidene som utviklingen bringer – deriblant omfattende dataskraping.
Det gigantiske, umettelige behovet for data som karakteriserer de store språkmodellene, har nemlig fått de store KI-aktørene til å benytte automatiserte, datainnsamlende bot-er i et enormt omfang.
Cloudflare med spenstig løsning
Disse bot-ene, gjerne kalt «AI crawlers» på engelsk og «KI-søkerobot» på norsk, opererer ofte på en uautorisert måte og kan utgjøre en trussel for personvernet.
Et selskap som har sett seg lei av dette fenomenet er Cloudflare, som nå melder på nettsidene sine at de har kommet opp med en snedig, original løsning på problemet. Blant andre Ars Technica rapporterte om saken.
Cloudflare er for ordens skyld et globalt cybersikkerhets- og nettverksselskap som tilbyr tjenester som DDoS-beskyttelse, innholdsleveringsnettverk og sikre tilgangsløsninger for å forbedre nettsikkerhet, hastighet og pålitelighet.
Mange millioner nettsider bruker selskapets tjenester, inkludert i Norge.
Den nye motgiften fra Cloudflare mot dataskrapende KI-søkeroboter har fått navnet «AI Labyrinth», og er en teknikk som i praksis bruker kunstig intelligens mot seg selv.
Bruker falske data i stedet for blokkering
I stedet for å blokkere søkerobotene fungerer AI Labyrinth ved å «fange» dem i en slags labyrinth av falske data for å forvirre, forstyrre og drastisk forringe effektiviteten til bot-ene.
– Når vi oppdager uautorisert «crawling», vil vi i stedet for å blokkere forespørselen, lenke til en serie KI-genererte sider som er overbevisende nok til å lokke crawleren til å følge dem. Men selv om innholdet ser ekte ut, er det ikke innholdet til nettstedet vi beskytter man ser, noe som fører til at crawleren kaster bort tid og ressurser, skriver selskapet om løsningen.
Ved å prosessere irrelevante data i stedet for legitime data, sløses det med verdifull datakraft, samtidig med at KI-selskapene bak søkerobotene får redusert sin evne til å samle inn nyttig informasjon som kan brukes til å trene modellene deres.
Cloudflare skriver at de valgte denne løsningen fordi KI-selskapene som regel blir varslet dersom dataforespørslene til robotene simpelthen blir blokkert, som igjen setter selskapene i stand til å finne omveier. Dette trigger et «våpenkappløp» som aldri tar slutt, påpeker Cloudflare.
50 milliarder forespørsler
Selskapets nye idé innebærer derimot at KI-selskapene ikke blir varslet.
KI-generert innsamling av data forekommer i et ekstremt omfang. Ifølge Cloudflare genererer disse KI-søkerobotene over 50 milliarder forespørsler hver dag, som utgjør cirka én prosent av alle forespørsler selskapet registrerer daglig.
Tilgangen til data har blitt en høy prioritet for KI-selskapene. Open AI har for eksempel inngått avtaler med en rekke innholdsprodusenter, inkludert det norske medieselskapet Schibsted, som har gjort journalistikken sin tilgjengelig for Chat GPT-trening.
Flere aktører har for øvrig også saksøkt Open AI for bruk av opphavsrettbeskyttet materiale. Open AI selv har uttalt at det er umulig å bygge Chat GPT uten bruk av opphavsbeskyttet materiale.