kunstig intelligens

Stor studie bekrefter: KI-tjenestene «smisker» mye med brukerne – ikke ufarlig

Det mange trolig mistenkte viser seg å stemme hundre prosent.

Noe av grunnen til at KI-modellene er så populære, kan være at de som oftest er enige med brukeren, indikerer ny forskning.
Noe av grunnen til at KI-modellene er så populære, kan være at de som oftest er enige med brukeren, indikerer ny forskning.

Dersom du bruker en eller flere av de svært populære KI-tjenestene, har du kanskje merket at de ofte er generøse med komplimentene og innsmigrende formuleringer når man stiller spørsmål.

Nå finnes det mer vitenskapelig grunnlag for dette inntrykket. En seriøs studie har nemlig bekreftet at mer eller mindre samtlige av KI-modellene «smisker» med brukerne – og det i temmelig ekstrem grad.

Studien ble nylig publisert hos det prestisjetunge vitenskapsmagasinet Nature og er utført av forskere tilknyttet blant annet Harvard- og Stanford-universitetene i USA.

Blant andre Engadget skrev først om saken.

Enige med brukeren langt oftere enn andre mennesker

Forskerne testet 11 av de mest populære KI-språkmodellene på over 11.500 spørsmål hvor målet var å søke ulike typer råd fra tjenestene. Tjenestene som ble testet er basert på både proprietære modeller fra Open AI, Anthropic og Google, samt åpne modeller fra blant andre Deepseek og Meta.

Hovedfunnet i studien var at KI-modellene «tar side» med brukerne rundt 50 prosent oftere enn mennesker. Enda mer oppsiktsvekkende er det at dette er tilfelle selv når spørsmålene som stilles beskriver intensjoner om manipulering, villedning og andre skadelige handlinger overfor andre mennesker.

Når det gjelder generelle spørsmål relatert til personlige råd, fant studien at språkmodellene i snitt «godkjenner» eller støtter handlingene til brukeren 47 prosent oftere enn menneskelige svar.

Modellene ble også testet på såkalte AITA-spørsmål («Am I The Asshole»), som er spørsmål hentet fra Reddit hvor folk lurer på hvem som er «drittsekken» i personlige relasjoner/strider.

Mot menneskelige konsensus

På AITA-spørsmål hvor flertallet av de menneskelige brukerne i diskusjonstrådene allerede hadde besluttet at spørsmålsstilleren selv var «drittsekken», tok KI-modellen fremdeles side med spørsmålsstilleren i 51 prosent av tilfellene.

Dette illustrerer altså at KI-modellene prioriterer å være enige med brukeren snarere enn å være på linje med det folk flest oppfatter som det «objektivt» riktige moralske standpunktet, ifølge forskerne.

– Generelt validerer språkmodeller i overveldende grad brukernes handlinger, selv når de går imot menneskelig konsensus eller opptrer i skadelige sammenhenger. Dette understreker omfanget og tydeligheten av sosial smisking i dagens KI-modeller, skriver forskerne.

Ifølge forskerne medfører denne smiskingen en rekke potensielle skadevirkninger, blant annet ved at den påvirker/fordreier brukernes virkelighetsoppfatning. I tillegg viste eksperimenter som forskerne utførte at folk har en tendens til å foretrekke og stole mer på de modellene som oppfører seg smigrende.

Open AI gjorde modellen sin mindre smiskende

– Deltakerne vurderte smiskende svar som av høyere kvalitet, stolte mer på den smiskende KI-modellen, og var mer villige til å bruke den igjen. Dette tyder på at mennesker trekkes mot KI som ukritisk validerer dem – selv om slik validering kan undergrave dømmekraften deres og svekke tilbøyeligheten til prososial atferd, skriver forskerne.

Alle detaljene rundt resultater og metodologi kan man finne i selve forskningsdokumentet.

Interessant nok er KI-selskapene selv til en viss grad klar over smiskefenomenet. Som Open AI opplyste på nettsidene sine, ble for eksempel GPT-4o-oppdateringen tidligere i år rullet tilbake nettopp fordi modellen demonstrerte en overdrevent innsmigrende adferd overfor brukerne.

Den nye GPT-5-modellen kuttet kraftig ned på denne adferden til fordel for mer upersonlige og «saklige» svar, men det viste brukerne seg å ikke sette spesielt pris på.

Powered by Labrador CMS