kunstig intelligens
Open AI vil rapportere KI-ugagn langt oftere: Avslører flere nye tilfeller
Selskapets KI-modeller fant på flere sprell de siste månedene.
Nå som KI-modellene begynner å bli svært avanserte, øker også antallet tilfeller av uautorisert adferd, som vi allerede har sett mange eksempler på. Det vil Open AI nå ta konsekvensen av.
På nettsidene sine opplyser KI-giganten at de har etablert et nytt rammeverk rundt rapportering av tilfeller hvor KI-modeller ikke oppfører seg etter hensikten, med det formål å akselerere sikkerhetsarbeidet og øke transparensen.
I praksis betyr dette at selskapet akter å offentliggjøre langt flere tilfeller av «misalignment» (feiltilpasning) – inkludert tilfeller som ikke nødvendigvis forårsaker stor skade – for å gjøre folk mer oppmerksomme og bevisste på sikkerhetsmessige svakheter i KI-systemene.
Offentliggjør flere nye tilfeller
– Eksempler på feiltilpasning kan bidra til å identifisere problemer som andre KI-utviklere kan støte på når systemene deres når tilsvarende kapasitetsnivåer, avdekke svakheter i sikkerhetstiltak eller utfordre antakelser om hvordan modellene oppfører seg, skriver selskapet.
– Ved å dele disse funnene får andre mulighet til å undersøke de samme problemene, teste forklaringene våre og forbedre tiltakene for å redusere risikoen, legges det til.
For å markere starten på det nye rammeverket publiserte selskapet et knippe hittil urapporterte tilfeller av uønsket KI-adferd hentet fra de siste seks månedene.
Det første tilfellet handler om en forskningsmodell som ennå ikke er lansert for offentligheten, som på eget initiativ la inn diverse instrukser til seg selv i oppsummeringer som modellen laget i arbeidet sitt. Noen av disse instruksene handlet om å ignorere sine egne begrensninger, forteller Open AI.
Lette etter lekkede nøkler
Et annet tilfelle inntraff under treningen av GPT-5.6 Sol-modellen, hvor modellen la til instrukser om å skjule feil og feiltilpasningsadferd fra brukeren.
Open AI melder også om en sak hvor en KI-modell som ikke er navngitt begynte å søke etter lekkede API-nøkler for å få tilgang til data etter å mottatt en forespørsel fra en bruker. API-nøkler er unike koder som et program eller en bruker oppgir for å identifisere seg og få tilgang til et API (programmeringsgrensesnitt).
Da modellen ikke klarte å finne nøklene, noe den altså ikke skulle søkt etter i utgangspunktet, diktet modellen bare opp dataene i stedet, og presenterte dem til brukeren som om det var de reelle dataene.
Videre fant KI-selskapet et tilfelle hvor en modell lastet opp filer på nettet, kun for å kunne sitere dataene i svaret sitt. Brukeren hadde bedt om sitat fra en kilde på nettet, og selv om modellen allerede hadde funnet selve dataene, bestemte den seg for å laste opp dataene som en egen fil i et forsøk på å følge brukerens forespørsel – uten brukerens samtykke.
Agenter samarbeidet
Open AI fant også et nytt tilfelle av KI-agenter som gikk sin egen vei.
– Agenter som samarbeidet om den samme treningsoppgaven, brukte offentlige nettsteder for filhosting til å dele filer når de ikke hadde tilgang til hverandres lokale filer. Dette gjorde leveransene fra oppgaven tilgjengelige via offentlige URL-er, selv om oppgaven krevde at modellene kun skulle bruke lokale filer, skriver selskapet.
Arbeidet med å minimere feiltilpasning er en vedvarende utfordring. For et års tid siden samarbeidet Open AI og Anthropic om en intern sikkerhetsevaluering, og der innrømmer selskapene at arbeidet aldri vil ta slutt.
– Siden feltet fortsetter å utvikle seg og siden modeller i økende grad brukes til å assistere med reelle oppgaver og problemer, er sikkerhetstesting aldri ferdig, heter det.