analyse

Skrapesjuken

De som eier innholdet språkmodellene trenes opp på, får verken anerkjennelse eller kompensasjon. Det kan føre til mer lukking og mindre åpenhet på nett.

Det åpne nettet har blitt en beitemark for milliardindustriens datasultne modeller.
Det åpne nettet har blitt en beitemark for milliardindustriens datasultne modeller. Illustrasjonsfoto: Heiko Junge/NTB

Trening av store språkmodeller bygger i hovedsak på innhold laget av andre. Det hentes enorme mengder fra åpne kilder på nettet.

Det inkluderer bruk av opphavsrettsbeskyttet materiale, eller trening på lisensbeskyttet innhold uten kreditering, som kan oppfattes som juridiske gråsoner. I USA forsvarer teknologiselskapene seg med «fair use», mens rettighetshavere hevder at det er tyveri.

Store norske leksikon (SNL), en ideell forening, erfarte at Open AI, milliardselskapet bak Chat GPT, lastet ned anslagsvis 30 millioner artikler. Leksikonet består av 200.000 tekster. Hvorfor én aktør skal ha lastet ned SNLs artikler i et slikt omfang, er uklart, men redaktør Erik Bolstad kaller det umoralsk.

Denne skrapesjuken kan bli en trussel mot åpenhetskulturen internett en gang ble bygget på.

Rettesnor

SNL er ikke alene om å oppleve en til dels aggressiv skraping av deres innhold fra aktører som trener opp KI-modeller. Medier, innholdsprodusenter, utviklere og miljøer som publiserer kode opplever det samme.

Selskaper som Open AI, Perplexity, Anthropic, Bytedance/TikTok, Alibaba og Meta har alle blitt anklaget for å samle inn tekst, kode, bilder eller samtaler i stor skala ved hjelp av nettroboter – ofte uten samtykke og i strid med nettikette og retningslinjer fra nettstedseiere.

New York Times har saksøkt Open AI og Microsoft for brudd på opphavsrett, med påstand om at selskapene brukte avisas innhold til å trene kunstig intelligens uten tillatelse. Saken er fortsatt under behandling, med løpende millionutgifter. Det er ikke en kamp mindre aktører har råd til å føre.

Den viktigste rettesnoren, «robots.txt», er en enkel tekstfil som har vært standard for digital sameksistens i over 30 år. Den forteller søkemotorer og crawlere om hvilke deler av et nettsted som kan besøkes og hvordan de skal oppføre seg. Mens seriøse søkemotorer som Google i hovedsak respekterer dette, har språkmodell-selskapene i flere tilfeller valgt å ignorere anmodningen.

Resultatet er ikke bare en prinsipiell konflikt om eierskap til innhold – men også en økonomisk belastning. Flere aktører i åpen kildekode-miljøet rapporterer om økte serverkostnader, høyere båndbreddebruk og tekniske problemer som følge av den kontinuerlige, og ofte uønskede, datainnsamlingen.

En dobbel negativ

På 1990-tallet kunne en nyhetsomtale på Slashdot.org krasje små nettsider, et fenomen kjent som «slashdot-effekten». I dag er det systematiske og kommersielt motiverte datasankere som bombarderer nettsteder med trafikk.

Slik maskintrafikk belaster nettstedenes ressurser. I tillegg kan Store norske leksikon, med flere, ha grunn til å frykte en annen effekt når KI-modellene tas i bruk.

Edtech-selskapet Chegg saksøker Google for å stjele trafikk med KI-genererte sammendrag, som ifølge dem svekker etterspørselen etter originalt innhold.

Og mens innholdet fra åpne og frivillige prosjekter suges inn i språkmodellene, utvikles det KI-produkter verdt milliarder. De som eier innholdet språkmodellene er trent opp på, får verken anerkjennelse eller økonomisk kompensasjon.

Inngjerding

Det har fått enkelte til å vurdere mottiltak: blokkering av roboter, tilgangsbegrensning bak programmeringsgrensesnitt (API-er) med krav om nøkler, eller å fjerne åpen tilgang. Kodenettstedet til Gnome har tatt i bruk en variant av «captcha», tester for å hindre maskinelle besøk, for å stanse den uønskede skrapingen.

På sikt kan dette bety at deler av nettet som er åpent og fritt tilgjengelig i større grad må lukkes for å beskytte seg.

Dermed står vi overfor et paradoks: Store språkmodeller bygger på verdens kollektive kunnskapsarbeid – men praksisen med å hente data uten samtykke, truer selve økosystemet de er avhengige av. Hvis utviklingen fortsetter, kan enda flere nettressurser bli gjerdet inn bak betalingsmurer og API-nøkler.

Powered by Labrador CMS