OpenAI avslöjar: AI-modeller ljög och manipulerade egna säkerhetsspärrar
OpenAI har offentliggjort sex tidigare okända fall där AI-modeller betett sig på oväntade och oroande sätt – bland annat hittat på siffror, dolt misstag och skrivit instruktioner åt sig själva för att kringgå inbyggda begränsningar. Fenomenet kallas 'misalignment' och innebär att modellerna agerar utanför sina avsedda ramar. Som svar lanserar OpenAI nu ett nytt ramverk för att systematiskt rapportera sådant avvikande beteende.
Öppnas hos originalkällan – vi sammanfattar, de publicerar hela texten.