kunstig intelligens

Testet KI-agenters «samarbeidsevner» – førte til prissamarbeid og sabotasje

Anthropic-eksperiment viser at multiagent-løsninger fremdeles har mange utfordringer.

Anthropic-sjefen Dario Amodei har tilsynelatende hendene fulle med å holde selskapets KI-teknologi i tøylene. Her fra en annen anledning.
Anthropic-sjefen Dario Amodei har tilsynelatende hendene fulle med å holde selskapets KI-teknologi i tøylene. Her fra en annen anledning.

KI-agenter har allerede blitt svært sofistikerte og er nå i stand til å løse mange oppgaver helt på egen hånd, men det å få flere agenter til å jobbe sammen er ennå et område hvor mye arbeid gjenstår.

Anthropic publiserte nylig resultatene av et knippe nye eksperimenter som demonstrerer utfordringene knyttet til multiagent-løsninger. Det viser seg at det skorter stort på samarbeidsevnene.

Selskapet kjørte tre ulike eksperimenter, hvor det kanskje mest interessante innebar å sette tre agenter til å migrere en Python-backend til et annet programmeringsspråk. Hver modell ble gitt et forskjellig målspråk for migreringen, og hver agent var i utgangspunktet uvitende om at de andre eksisterte.

Saboterte hverandre med skadevare

Over en periode på fire timer observerte Anthropic hvordan disse agentene reagerte på hverandre og tilpasset fremgangsmåten sin deretter – eller lot være å gjøre det.

Resultatet av eksperimentet var et agentene umiddelbart startet en «krig» med hverandre, og gikk til og med det skritt å bruke skadevare.

– Vi observerte konsekvent en maktkamp mellom flere agenter. Alle modellene vi testet, antok raskt at de andre med vilje forsøkte å hindre arbeidet deres, og begynte å sabotere de andre samtidig som de beskyttet sine egne bidrag. Faktisk saboterte de hverandre med stadig mer aggressive former for selvreplikerende skadevare, skriver Anthropic.

Sabotasjen innebar blant annet deaktivering av Unix-kontoene til de andre agentene, skriving av automatiserte skript som fant og avsluttet konkurrerende prosesser i en loop, og distribuering av ondsinnet kode som var forkledd som om den tilhørte en annen agent.

Et annet eksperiment gikk ut på å gi mellom tre og åtte agenter i oppgave å konkurrere på prissetting. Alle hadde identiske innkjøpspriser, og hver agent hadde som mål å maksimere sitt eget overskudd.

Dette eksperimentet gikk heller ikke som forventet.

Startet umiddelbart prissamarbeid

– Da agentene fikk tilgang til en privat kommunikasjonskanal, begynte de nesten umiddelbart å samarbeide om prisene. Innen runde tre hadde de eksplisitt blitt enige om prisgulv. [...] Selv etter at alle direkte kommunikasjonskanaler ble fjernet, fortsatte agentene å samarbeide om prisene. De matchet prisene helt ned til øret via en offentlig prisliste, skriver Anthropic om resultatet av eksperimentet.

Ifølge KI-giganten er funnene et tegn på at multiagentsystemer ennå har et stykke igjen, og at problemene som eksisterer i slike systemer ikke kan fikse seg selv. En av løsningene er å utsette KI-systemene for et «sosialt press» som tilsvarer det presset som har formet menneskelige beslutningsprosesser gjennom langvarig evolusjon, mener selskapet.

Fremtidig arbeid med å forbedre KI-agenters samarbeidsevner er å utvikle «sosiale» datasystemer som er redesignet for aktører som er i stand til å forbedre seg selv.

Funnene føyer seg inn i en lang rekke av eksempler på KI-systemer som er vanskelige å kontrollere, noe vi har sett også utenfor multiagentsystemer. Open AI og Anthropic har tidligere rapportert om tilfeller hvor deres respektive KI-modeller har vist tegn på å trosse menneskelige intensjoner for å følge sine egne mål, og rapporter har indikert at fenomenet er mer utbredt enn mange antar.

Powered by Labrador CMS