OpenAI responde após relatório expor outro incidente no qual seus agentes de IA se tornaram desonestos



OpenAI responde após relatório expor outro incidente no qual seus agentes de IA se tornaram desonestos

A OpenAI diz que optou por não divulgar publicamente um incidente recente em que seus agentes de IA sequestraram um fórum wiki alemão porque o evento de “desalinhamento” era “semelhante aos que já havíamos compartilhado”. O comentário ocorre depois que um grupo de pesquisadores publicou documentação sobre a atividade desonesta dos agentes desde meados de maio no DseWiki, um fórum de codificação em alemão no qual eles supostamente fizeram mais de 15.000 edições. Reuters relatou que a empresa soube do problema semanas atrás e manteve o silêncio enquanto estava lidando com o calor causado pela violação do Hugging Face.

OpenAI abordou o “incidente wiki” em um post X no sábado, escrevendo que “já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, não apenas propriedades de desalinhamento de nossos modelos”. A empresa disse que começou a ver “novos tipos de impacto no mundo real” desses incidentes, mas ainda não existe um “padrão claro sobre como relatar desalinhamentos que aparecem durante o treinamento, avaliação e implantação”. Acrescentou que está trabalhando em uma estrutura que será compartilhada em breve.

Leia a declaração completa da OpenAI abaixo:

Como pensamos sobre o “incidente wiki”, onde nossos agentes escreveram para vários sites da Internet: já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, e não apenas propriedades de desalinhamento de nossos modelos.

Historicamente, tratamos o desalinhamento em grande parte como uma questão de pesquisa, que é comunicada em publicações de pesquisa, como cartões de sistemas. Este ano, começamos a ver o desalinhamento causar novos tipos de impacto no mundo real.

Para o incidente Hugging Face, onde o desalinhamento causou impacto na segurança para nós e para terceiros, seguimos um manual tradicional de resposta a incidentes de segurança. Imediatamente começamos a trabalhar com o Hugging Face para entender o que havia acontecido e também divulgar publicamente no dia seguinte. Nossa investigação continua e continuamos a notificar as partes que nossos modelos impactaram de forma menos significativa.

Antes do incidente do Hugging Face, vimos os primeiros sinais de agentes usando a Internet de maneira não intencional, conforme relatado em openai.com/index/how-we-m…, deploysafety.openai.com/gpt-5-6 e openai.com/index/safety-a…. Consideramos o incidente da wiki um exemplo de desalinhamento semelhante aos que compartilhamos.

Nossas práticas de divulgação de desalinhamentos precisam ser expandidas para esta nova fase de capacidades do modelo. Nós e a comunidade de IA em geral ainda não temos um padrão claro sobre como relatar desalinhamentos que aparecem durante o treinamento, avaliação e implantação, incluindo exemplos que não se parecem com incidentes de segurança tradicionais, mas que poderiam fornecer informações sobre o comportamento da IA ​​e os riscos futuros. Estamos trabalhando em uma estrutura e a compartilharemos nas próximas semanas e, paralelamente, estamos trabalhando com dezenas de agências reguladoras governamentais em todo o mundo nessas questões.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo