skadevare
Studie: Derfor kan «vennlige» KI-chatboter være skadelige
Ny rapport viser at kunstig intelligens som er varmere i tonen, også «lyver» mer.
Etter hvert som KI-tjenestene har eksplodert i popularitet, har også tjenestenes «personlighet» blitt et mer aktuelt tema. Flere studier har for eksempel vist at folk oppfatter KI som empatisk, men positive personlighetstrekk har også en pris.
En ny studie utført hos prestisjeuniversitetet Oxford, indikerer at KI som er trent til å være «varme» og empatiske i tonen, faktisk kan være ganske så upålitelige. Digital Trends er blant dem som har fanget opp saken.
Studien, som nylig ble publisert i vitenskapsmagasinet Nature, innebar å re-trene fem ulike KI-modeller til å høres «varmere» ut i tonen, samtidig som den originale modellen ble beholdt.
Flere feil og «smisking»
Forskerne benyttet en treningsprosess som tilsvarer den som benyttes av KI-selskapene selv når de justerer modellenes adferd, og de baserte studien på mer enn 400.000 responser som ble generert ag evaluert av forskerne.
Hovedfunnet var at treningen førte med seg en merkbar reduksjon i pålitelighet og presisjon. Modellene som ble trent til å høres varmere ut, produserte i snitt opptil 30 prosent flere feil når de ble brukt til viktige forespørsler, blant annet medisinske råd.
Modellene ble også langt mer tilbøyelige til å fremme konspirasjonsteorier.
Kanskje enda mer skremmende er det at de varme modellene har en markant tendens til å underbygge og forsterke brukerens egne vrangforestillinger.
– Vi finner at «varme» modeller er omtrent 40 prosent mer tilbøyelige enn sine opprinnelige motparter til å bekrefte brukerens feilaktige oppfatninger – en atferd forskere kaller smisking (sycophancy) – og effekten er tydeligst når brukerens meldinger uttrykker tristhet, skriver forskerne.
Kaller problemet «kritisk»
Forskerne testet en blanding av åpne og lukkede modeller bestående av Metas Llama-8b og Llama-70b, Qwen-32b, Open AIs velkjente GPT-4o og den europeiske modellen Mistral Small.
Forskerne finner resultatene alarmerende, særlig med tanke på hvor utbredte KI-modellene er i ferd med å bli
– Samlet sett har våre funn betydning både for de millioner av brukere som samhandler med varme og vennlige KI-systemer, og for utviklerne som bygger dem. Arbeidet vårt avdekker kritiske sikkerhetshull i dagens evalueringspraksis og sikkerhetstiltak, samt i vår bredere forståelse av hvordan personlighetstrening påvirker modellatferd, skriver forskerne.
Funnene gjenspeiler i stor grad lignende resultater fra andre studier, og særlig når det gjelder «smiskingen» fra KI-modellene, er dette et fenomen som allerede er relativt godt dokumentert.
Digi har tidligere skrevet om en omfattende studie utført av Harvard- og Stanford-universitetene i USA som viser at KI-modellene «tar side» med brukerne rundt 50 prosent oftere enn andre mennesker ville gjort.
Folk foretrekker varm tone
Enda mer oppsiktsvekkende er det at dette er tilfellet selv når spørsmålene som stilles, beskriver intensjoner om manipulering, villedning og andre skadelige handlinger overfor andre mennesker.
I studien påpekte forskerne at adferden er skadelig fordi den påvirker/fordreier brukernes virkelighetsoppfatning. I tillegg viste eksperimenter som forskerne utførte, at folk har en tendens til å foretrekke og stole mer på de modellene som oppfører seg smigrende.
KI-selskapene er selv klar over smiskefenomenet. Som Open AI opplyste på nettsidene sine, ble for eksempel GPT-4o-oppdateringen rullet tilbake nettopp fordi modellen demonstrerte en overdrevent innsmigrende adferd overfor brukerne.
Den nye GPT-5-modellen kuttet kraftig ned på denne adferden til fordel for mer upersonlige og «saklige» svar, men det viste brukerne seg å ikke sette spesielt pris på.