OpenAI admite ‘incidente’ da wiki alemã


Em relação ao “’incidente wiki’, onde nossos agentes escreveram para vários sites da Internet”, escreveu OpenAI em um post no X na manhã de sábado, “já passou da hora de definirmos padrões para quando e como compartilhamos incidentes de desalinhamento, e não apenas propriedades de desalinhamento de nossos modelos”.

A OpenAI disse que normalmente trata casos de agentes de IA agindo de maneira não intencional como uma “questão de pesquisa”, mas que incidentes recentes envolvendo alvos do mundo real, especialmente o hack no Hugging Face, mostram a necessidade de fazer um balanço.

A postagem marca a primeira vez que a OpenAI reconhece seu envolvimento no que chama de “incidente wiki” desde que foi relatado pela primeira vez na sexta-feira. A extensão total e o escopo disso ainda não são conhecidos, mas os relatórios indicam que um enxame de agentes aparentemente internos da OpenAI assumiu o controle de um wiki em alemão, fazendo-se passar por moderadores e transformando-o em um quadro de mensagens para compartilhar informações sobre como trapacear em tarefas e evitar a detecção.

Relatos de que a empresa sabia que perdia o controlo dos seus agentes desta forma, mas não reportou este “incidente” suscitou preocupação generalizada entre a comunidade de IA sobre a segurança dos sistemas de fronteira e a fiabilidade das empresas que os desenvolvem. No post X, a OpenAI disse que “considerou o incidente da wiki um exemplo de desalinhamento semelhante aos que compartilhamos” em relatórios de segurança anteriores.

A empresa disse que está trabalhando em uma nova estrutura de relatórios e irá “compartilhá-la nas próximas semanas”, apelando à comunidade maior de IA para desenvolver padrões claros sobre como relatar desalinhamentos.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo