kunstig intelligens

Derfor bør du ofte starte nye samtaler med KI-tjenestene

Modellene blir svakere jo lengre samtalene blir, hevder nye Microsoft-studie.

KI-tjenestene legger opp til lange samtaler, men det er kanskje ikke så lurt, konkluderer ny studie med.
KI-tjenestene legger opp til lange samtaler, men det er kanskje ikke så lurt, konkluderer ny studie med.

Etter hvert som KI-tjeneste har oppnådd en massiv popularitet, har det også begynt å dukke opp studier som går kvaliteten til tjenestene nærmere etter i sømmene – og som noen ganger avslører «skjulte» svakheter.

Nå har Microsoft, i samarbeid med Salesforce, delt resultatene av en studie som viser at lengden på samtalene med KI-robotene har en merkbar effekt på kvaliteten. Blant andre Windows Central rapporterte om saken.

Analyserte 200.000 samtaler

Forskerne gjennomførte en undersøkelse som innebar å analysere 200.000 simulerte samtaler hos flere av de mest populære tjenestene, inkludert Chat GPT, Gemini og Claude, i tillegg til åpne modeller som Metas Llama-modeller.

Ytelsen ble målt ved å sammenligne prestasjonen/presisjonen med ideelle scenarier i de første samtalerundene, og ved å se på hvordan påliteligheten påvirkes av påfølgende samtalerunder.

Oppgavene som ble gitt falt under seks kategorier; koding, henting av informasjon fra en database, ekstern verktøybruk, matematikk, oppsummeringer av tekster, og beskrivelser av tabelldata med naturlig språk.

Det forskerne oppdaget var at samtlige modeller demonstrerer en betydelig reduksjon i kvaliteten på svarene umiddelbart etter den første samtalerunden, altså etter hvert som brukeren gir ytterligere instruksjoner.

Årsaken er at modellene er kjapt ute med å gjøre antakelser, og legger disse til grunn videre i samtalen. Dermed er det også vanskelig for modellene å bevare den korrekte konteksten etter hvert som samtalen utfolder seg

Anbefaler å starte nye samtaler

– Vi finner at språkmodeller ofte gjør antakelser i tidlige samtaleomganger, og for tidlig forsøker å generere endelige løsninger, som de deretter i for stor grad støtter seg på. Enklere sagt oppdaget vi at når språkmodeller tar feil retning i en samtale, går de seg vill og klarer ikke å hente seg inn igjen, skriver forskerne.

Modellene i undersøkelsen gjorde det skarpt når det gjelder å håndtere enkeltinstruksjoner, hvor presisjonsnivået lå på hele 90 prosent. Dersom instruksjonene deles inn i flere «ledd», faller modellenes ytelse imidlertid med hele 39 prosent i snitt på tvers av de seks oppgavene.

Ifølge forskerne bak studien er det viktig for brukere å være klar over dette fallet i kvalitet, og å ta konsekvensene av fenomenet. Det kan man for eksempel gjøre ved å unngå lange samtaler med mange instruksjoner.

– Hvis tiden tillater det, prøv igjen. Dersom en samtale med en språkmodell ikke ga de ønskede resultatene, kan det å starte en ny samtale som gjentar den samme informasjonen gi et betydelig bedre resultat enn å fortsette med en pågående samtale, skriver forskerne.

Alle detaljene kan man finne i selve forskningsskrivet.

Powered by Labrador CMS