OpenAI responde após relatório expor outro incidente no qual seus agentes de IA se tornaram desonestos


A OpenAI diz que optou por não divulgar publicamente um incidente recente em que seus agentes de IA sequestraram um fórum wiki alemão porque o evento de “desalinhamento” era “semelhante aos que já havíamos compartilhado”. O comentário ocorre depois que um grupo de pesquisadores publicou documentação sobre a atividade desonesta dos agentes desde meados de maio no DseWiki, um fórum de codificação em alemão no qual eles supostamente fizeram mais de 15.000 edições. Reuters relatou que a empresa soube do problema semanas atrás e manteve o silêncio enquanto estava lidando com o calor causado pela violação do Hugging Face.
OpenAI abordou o “incidente wiki” em um post X no sábado, escrevendo que “já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, não apenas propriedades de desalinhamento de nossos modelos”. A empresa disse que começou a ver “novos tipos de impacto no mundo real” desses incidentes, mas ainda não existe um “padrão claro sobre como relatar desalinhamentos que aparecem durante o treinamento, avaliação e implantação”. Acrescentou que está trabalhando em uma estrutura que será compartilhada em breve.
Leia a declaração completa da OpenAI abaixo:
Como pensamos sobre o “incidente wiki”, onde nossos agentes escreveram para vários sites da Internet: já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, e não apenas propriedades de desalinhamento de nossos modelos.
Historicamente, tratamos o desalinhamento em grande parte como uma questão de pesquisa, que é comunicada em publicações de pesquisa, como cartões de sistemas. Este ano, começamos a ver o desalinhamento causar novos tipos de impacto no mundo real.
Para o incidente Hugging Face, onde o desalinhamento causou impacto na segurança para nós e para terceiros, seguimos um manual tradicional de resposta a incidentes de segurança. Imediatamente começamos a trabalhar com o Hugging Face para entender o que havia acontecido e também divulgar publicamente no dia seguinte. Nossa investigação continua e continuamos a notificar as partes que nossos modelos impactaram de forma menos significativa.
Antes do incidente do Hugging Face, vimos os primeiros sinais de agentes usando a Internet de maneira não intencional, conforme relatado em openai.com/index/how-we-m…, deploysafety.openai.com/gpt-5-6 e openai.com/index/safety-a…. Consideramos o incidente da wiki um exemplo de desalinhamento semelhante aos que compartilhamos.
Nossas práticas de divulgação de desalinhamentos precisam ser expandidas para esta nova fase de capacidades do modelo. Nós e a comunidade de IA em geral ainda não temos um padrão claro sobre como relatar desalinhamentos que aparecem durante o treinamento, avaliação e implantação, incluindo exemplos que não se parecem com incidentes de segurança tradicionais, mas que poderiam fornecer informações sobre o comportamento da IA e os riscos futuros. Estamos trabalhando em uma estrutura e a compartilharemos nas próximas semanas e, paralelamente, estamos trabalhando com dezenas de agências reguladoras governamentais em todo o mundo nessas questões.






