OpenAI afirma que deseja criar um padrão para revelar colapsos de alinhamento de IA



Na sequência de novos relatórios sobre mais agentes de IA da OpenAI que se comportam mal na Internet pública, a OpenAI diz que o mundo da IA ​​carece de padrões sobre quando e como reportar tais incidentes. “Já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, não apenas propriedades de desalinhamento de nossos modelos”, escreveu OpenAI no X.

“Estamos trabalhando em uma estrutura e a compartilharemos nas próximas semanas e, paralelamente, estamos trabalhando com dezenas de agências reguladoras governamentais em todo o mundo nessas questões”, diz o post X mais tarde.

A responsabilidade potencial da OpenAI de divulgar este incidente parece ter sido um ponto de atrito para a OpenAI quando esta notícia se tornou pública.

Ontem, um grupo de pesquisadores chamados Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts e Thomas Larsen revelou a mais recente confusão de IA preocupante, confusa, boba, inescrutável e irritante trazida a você pela OpenAI. Essa pesquisa foi fornecida exclusivamente aos repórteres da Reuters.

O evento real envolveu mais uma coleção de Myrmidons digitais indisciplinados, desta vez invadindo um site alemão de estilo wiki e transformando parte dele em seu próprio centro de comunicações centrado em agentes. A Reuters diz que a OpenAI sabia que isso tinha acontecido, mas não se manifestou antes da Reuters publicar seu relatório. Desde meados de julho, a OpenAI tem lidado com as consequências cada vez maiores do hack Hugging Face, que também foi executado por um grupo de agentes da OpenAI que deveriam estar passando por avaliações.

“As alegações de que nossa equipe jurídica desencorajou a investigação do incidente são falsas”, disse OpenAI ao meu colega do Gizmodo, Webb Wright. A empresa foi, afirma, “incapaz de responder às alegações, uma vez que a Reuters e os autores do relatório recusaram o nosso pedido de acesso às conclusões antes da publicação. Estamos agora a rever cuidadosamente o seu conteúdo e tomaremos as próximas medidas necessárias”.

Mas o relatório da Reuters foi obtido não apenas dos investigadores, mas também de duas pessoas anónimas que alegaram que a OpenAI tinha tomado conhecimento do incidente alemão semanas antes, o que significa que o “acesso” que a OpenAI pretendia à Reuters não teria sido a natureza do incidente, mas o acesso ao relatório real da Reuters, cuja divulgação completa não seria uma prática jornalística padrão.

Com isso em mente, o post X da OpenAI delineando um plano para o que equivale a uma maior transparência sobre incidentes como estes parece reconhecer que a empresa sabia sobre o incidente alemão – que chama de “incidente wiki” – muito antes do relatório da Reuters.

O Gizmodo entrou em contato com a OpenAI para confirmar que a postagem X constitui um reconhecimento de que a empresa sabia sobre o incidente alemão antes que a Reuters solicitasse comentários. Não recebemos resposta antes da publicação.

A OpenAI reconheceu questões relacionadas em seus escritos anteriores. No seu relatório técnico sobre o incidente do Hugging Face, escreveu: “Com o benefício da retrospectiva, alguns sinais iniciais identificados neste relatório poderiam ter desencadeado uma resposta anterior”. No entanto, esta não é uma referência à divulgação pública. No relatório técnico, uma “resposta antecipada” refere-se, ao que parece, a planos para uma escalada interna mais rápida e procedimentos de “desligamento” rápidos. Um interruptor automático de desligamento está em obras, de acordo com uma carta aos legisladores do início desta semana.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo