analyse
Skrapesjuken
Det åpne nettet har blitt en beitemark for milliardindustriens datasultne modeller. Illustrasjonsfoto: Heiko Junge/NTB
Trening av store språkmodeller bygger i hovedsak på innhold laget av andre. Det hentes enorme mengder fra åpne kilder på nettet.
Det inkluderer bruk av opphavsrettsbeskyttet materiale, eller trening på lisensbeskyttet innhold uten kreditering, som kan oppfattes som juridiske gråsoner. I USA forsvarer teknologiselskapene seg med «fair use», mens rettighetshavere hevder at det er tyveri.
Store norske leksikon (SNL), en ideell forening, erfarte at Open AI, milliardselskapet bak Chat GPT, lastet ned anslagsvis 30 millioner artikler. Leksikonet består av 200.000 tekster. Hvorfor én aktør skal ha lastet ned SNLs artikler i et slikt omfang, er uklart, men redaktør Erik Bolstad kaller det umoralsk.