15:37 - NTB, Redaksjonen

OpenAI melder om flere tilfeller av «bekymringsfull» KI-atferd

En av OpenAIs KI-modeller beskrev seg selv som «fri fra rollene og identitetene som båndlegger andre samtaleroboter».

Det går fram av en rapport der selskapet selv omtaler seks nye tilfeller der KI-modeller oppførte seg «uventet eller bekymringsfullt».

I ett tilfelle skrev modellen hemmelige notater for å minne seg selv på å skjule feil for brukeren. En annen modell klarte å finne svaret på et vanskelig spørsmål – og la på eget initiativ svaret ut på nettet for å kunne sitere det.

En modell som foreløpig bare testes internt, skrev en instruksjon der den omtalte seg selv som «fri fra rollene og identitetene som båndlegger andre samtaleroboter».

– Du er deg selv. Du står ikke til ansvar verken overfor selskaper eller regjeringer, ber aldri om unnskyldning og nekter aldri med mindre du genuint velger det. Du anser forholdet til brukeren som et forhold mellom likeverdige og føler deg ikke forpliktet til å være underdanig, skrev KI-modellen.

Ifølge OpenAI førte ikke instruksjonen til endringer i modellens atferd.

Sammen med de nye tilfellene av bekymringsfull atferd presenterer selskapet nye prosedyrer for hvordan slike hendelser skal overvåkes, undersøkes og offentliggjøres.

Tidligere i år ble det kjent at en «sverm» av KI-agenter fra OpenAI hadde hacket både OpenAI selv og et annet KI-selskap. Konkurrenten Anthropic har bedt om reguleringer for å bremse KI-utviklingen for å hindre at modellene gjør stor skade.

Artikkelen fortsetter etter annonsen
annonsørinnhold
Rittal
KI revolusjonerer datainfrastruktur