kunstig intelligens
KI-gigantene advarer: Snart kan vi miste oversikten over hvordan KI-modellene «tenker»
Open AI, Meta, Google og Anthropic har signert felles brev.
KI-utviklingen går nå så raskt at til og med KI-selskapene selv har begynt å innse at det er på tide å ta de potensielle faremomentene alvorlig – i en slik grad at de nå kommer med en direkte advarsel.
Forskere fra de sentrale KI-aktørene Open AI, Google DeepMind, Anthropic og Meta signerte nylig et felles, åpent brev som tar for seg det de mener er en undervurdert fare ved KI-modellene.
Nettstedet Quartz er blant dem som har fortalt om brevet.
Kan bli vanskelige å overvåke
Brevet, som kan leses i sin helhet på denne siden, fokuserer på problemene ved å overvåke den indre virkemåten til KI-modellene, eller selve «tankerekken» – kalt «chain of thought» på engelsk (CoT).
Forskerne som har signert brevet, mener dagens CoT-metoder vil møte på store problemer etter hvert som modellene raskt blir mer avanserte, særlig de såkalte resonneringsmodellene.
Den vanlige treningsmetoden for KI-modeller hittil har vært en type RL-trening (reinforcement learning) som i stor grad er basert på menneskelige tilbakemeldinger, veiledning og evaluering – noe som gjør overvåkningsprosessen enklere.
De nye og mer avanserte resonneringsmodellene opererer imidlertid med RL-trening basert på kun sluttresultatet av resonneringsprosessen og i langt mindre grad selve prosessen og hvordan modellen kom frem til svaret. Dette svekker modellenes insentiv til å være transparente, sier forskerne.
Kan ikke garantere fremtidig transparens
– Overvåkning av tankerekker kan slutte å fungere i mer avanserte, situasjonsbevisste modeller. Fremtidige modeller kan bli i stand til å unngå oppdagelse ved å undertrykke sin tendens til å «tenke høyt» og, når resonnering er nødvendig, bevisst tilsløre den, skriver forskerne.
Det hevdes at evnen til å overvåke tankerekkene til resonneringsmodeller er avhengig av hvordan modellene trenes i dag og at det finnes flere måter å undergrave CoT-overvåking på.
Forskerne påpeker i brevet at CoT-overvåkning er det viktigste verktøyet vi har i dag for å sikre en grad av transparens og innsikt i hvordan modellene fungerer, men at metodene må forbedres i tiden fremover.
– CoT-overvåkning utgjør et verdifullt tillegg til sikkerhetstiltak for avansert KI og gir et sjeldent innblikk i hvordan KI-agenters beslutninger fattes. Det finnes imidlertid ingen garanti for at dagens grad av innsikt vil vedvare. Vi oppfordrer forskningsmiljøet og utviklere av avansert KI til å utnytte muligheten CoT-overvåkning gir, og til å undersøke hvordan denne innsikten kan bevares, skiver forskerne i konklusjonen.
– Uten sidestykke
Problemene knyttet til manglende transparens i KI-modeller har også tidligere blitt belyst. Som Digi tidligere har fortalt, la Antropic-sjefen Dario Amodei ut et blogginnlegg hvor han antyder at utviklerne selv ikke fullt ut forstår hvordan KI-modellene fungerer.
– Folk utenfor fagfeltet blir ofte overrasket og urolige når de får vite at vi ikke forstår hvordan våre egne KI-kreasjoner fungerer. Det er all grunn til bekymring: Denne mangelen på forståelse er i stor grad uten sidestykke i teknologiens historie, skriver Amodei i innledningen til teksten.
Han påpeker at moderne, generative KI-systemer er «ugjennomsiktige» på en måte som er fundamentalt forskjellig fra tradisjonell programvare, og han tar til orde for utvikling av en «MR-skanner for kunstig intelligens» – noe Anthropic allerede har begynt arbeidet med.