kunstig intelligens
Derfor bør du ofte starte nye samtaler med KI-tjenestene
Modellene blir svakere jo lengre samtalene blir, hevder nye Microsoft-studie.
Etter hvert som KI-tjeneste har oppnådd en massiv popularitet, har det også begynt å dukke opp studier som går kvaliteten til tjenestene nærmere etter i sømmene – og som noen ganger avslører «skjulte» svakheter.
Nå har Microsoft, i samarbeid med Salesforce, delt resultatene av en studie som viser at lengden på samtalene med KI-robotene har en merkbar effekt på kvaliteten. Blant andre Windows Central rapporterte om saken.
Analyserte 200.000 samtaler
Forskerne gjennomførte en undersøkelse som innebar å analysere 200.000 simulerte samtaler hos flere av de mest populære tjenestene, inkludert Chat GPT, Gemini og Claude, i tillegg til åpne modeller som Metas Llama-modeller.
Ytelsen ble målt ved å sammenligne prestasjonen/presisjonen med ideelle scenarier i de første samtalerundene, og ved å se på hvordan påliteligheten påvirkes av påfølgende samtalerunder.
Oppgavene som ble gitt falt under seks kategorier; koding, henting av informasjon fra en database, ekstern verktøybruk, matematikk, oppsummeringer av tekster, og beskrivelser av tabelldata med naturlig språk.
Det forskerne oppdaget var at samtlige modeller demonstrerer en betydelig reduksjon i kvaliteten på svarene umiddelbart etter den første samtalerunden, altså etter hvert som brukeren gir ytterligere instruksjoner.
Årsaken er at modellene er kjapt ute med å gjøre antakelser, og legger disse til grunn videre i samtalen. Dermed er det også vanskelig for modellene å bevare den korrekte konteksten etter hvert som samtalen utfolder seg
Anbefaler å starte nye samtaler
– Vi finner at språkmodeller ofte gjør antakelser i tidlige samtaleomganger, og for tidlig forsøker å generere endelige løsninger, som de deretter i for stor grad støtter seg på. Enklere sagt oppdaget vi at når språkmodeller tar feil retning i en samtale, går de seg vill og klarer ikke å hente seg inn igjen, skriver forskerne.
Modellene i undersøkelsen gjorde det skarpt når det gjelder å håndtere enkeltinstruksjoner, hvor presisjonsnivået lå på hele 90 prosent. Dersom instruksjonene deles inn i flere «ledd», faller modellenes ytelse imidlertid med hele 39 prosent i snitt på tvers av de seks oppgavene.
Ifølge forskerne bak studien er det viktig for brukere å være klar over dette fallet i kvalitet, og å ta konsekvensene av fenomenet. Det kan man for eksempel gjøre ved å unngå lange samtaler med mange instruksjoner.
– Hvis tiden tillater det, prøv igjen. Dersom en samtale med en språkmodell ikke ga de ønskede resultatene, kan det å starte en ny samtale som gjentar den samme informasjonen gi et betydelig bedre resultat enn å fortsette med en pågående samtale, skriver forskerne.
Alle detaljene kan man finne i selve forskningsskrivet.