kunstig intelligens

Forskere: Slik har KI begynt å «ødelegge» seg selv på internett

Enorme mengder KI-generert innhold på internett har negative konsekvenser, sier forskere.

KI-modeller som Chat GPT blir dårligere av alt det KI-genererte innholdet på nettet, ifølge ny forskning.
KI-modeller som Chat GPT blir dårligere av alt det KI-genererte innholdet på nettet, ifølge ny forskning. Illustrasjonsfoto: Colourbox

KI-generert innhold, på godt og vondt, er raskt i ferd med å bli så utbredt at det nærmest har blitt normen snarere enn unntaket. Nå foreligger det forskning som viser at mengden KI-generert innhold er større enn mange trolig er klar over, og også at dette kan ha store negative følger.

Digital Trends og Forbes rapporterte nylig at Amazon Web Services har utført en studie som indikerer at så mye som 57 prosent av web-basert tekst har blitt maskinelt oversatt – altså oversatt ved hjelp av KI-teknologi.

Forskerne bak studien kaller mengden maskinoversatt tekst på nettet «sjokkerende».

Fører til lavere KI-kvalitet

En separat studie utført av en gruppe forskere fra de anerkjente Cambridge- og Oxford-universitetene i Storbritannia belyser hvorfor den store mengden KI-innhold kan true kvaliteten på selve KI-verktøyene.

Studien, som ble publisert i vitenskapsmagasinet Nature i sommer, peker på at KI-generert innhold på nettet fører til en kraftig reduksjon i kvaliteten og påliteligheten til de generative KI-modellene som nå er blitt så tallrike og velbrukte.

Disse KI-modellene trenes som kjent i stor grad på innhold på nettet, og i den grad treningsdataene i seg selv er KI-genererte, fører dette til en negativ spiral som forringer kvaliteten på modellene.

– Vi finner at vilkårlig bruk av modellgenerert innhold i trening forårsaker irreversible feil i de resulterende modellene, der ytterkantene av den opprinnelige innholdsfordelingen forsvinner, heter det i forskningsteksten.

Forskerne har gitt fenomenet det talende navnet «modellkollaps».

Teamet gjennomførte et eksperiment med en språkmodell kalt «OPT-125m», utviklet av Meta, som ble finjustert på data generert av dens egne tidligere generasjoner.

Avviker fra treningsdataene

De fant at modeller som ble trent på genererte data har en tendens til å produsere mindre mangfoldige og mer repetitive resultater. Det ble observert en nedgang i ytelsen, ettersom de genererte dataene i økende grad avvek fra de opprinnelige treningsdataene, noe som førte til høyere usikkerhet/forvirring og modellkollaps.

Det er allerede en kjent sak at KI-modeller ofte lider av unøyaktigheter og skavanker kjent som «hallusinasjoner», hvor modeller som Chat GPT kan finne på ting og presentere dem som fakta, noe som betyr at man ikke kan stol blindt på hva maskinen forteller deg.

Det er uvisst i hvilken grad dette fenomenet henger sammen med det forskerne kaller modellkollaps.

De britiske forskerne har tilsynelatende ingen umiddelbar løsning på problemet. Modellkollaps-fenomenet kan imidlertid kanskje forklare hvorfor blant andre Open AI bruker mye ressurser på å knytte til seg store leverandører av menneskeskapt innhold.

Å bruke menneskeskapt innhold til å trene modellene har imidlertid sine egne utfordringer, ikke minst i form av juridiske problemer rundt bruk av opphavsbeskyttet materiale.

Powered by Labrador CMS