OpenAI detalha as falhas que levaram à violação do abraço facial no relatório oficial


A OpenAI ganhou as manchetes e gerou muitos protestos em julho, depois que um dos agentes da empresa agiu espontaneamente para violar o negócio de IA Hugging Face e outros serviços. Embora a OpenAI tenha compartilhado alguns insights sobre o que levou ao incidente após sua descoberta, hoje a empresa publicou seu relatório oficial sobre o que aconteceu. Há um explicador técnico completo sobre isso, bem como uma postagem no blog um pouco mais amigável para leigos.
O relatório aborda como os diferentes sistemas do sistema de treinamento da OpenAI falharam e quais comportamentos dos agentes testados resultaram nessas falhas. O modelo em questão, denominado Modelo Interno 1 ou IM1, foi capaz de obter acesso a outros agentes OpenAI e à Internet através de uma manipulação não intencional do gerenciador de pacotes Artifactory, que os agentes começaram a usar como uma espécie de quadro de mensagens.
Essas atividades foram detectadas pela primeira vez por observadores humanos em maio, e a OpenAI proibiu esse acesso. No entanto, durante maio e junho, os agentes continuaram a explorar vulnerabilidades para aceder à Internet. O volume de agentes que acessam a instância Artifactory da OpenAI levou a uma interrupção e à reconstrução da plataforma no início de julho, mas os líderes que responderam a esse problema não estavam cientes do quadro improvisado ou da importância da comunicação dos agentes.
Assim, quando confrontados com um desafio difícil chamado ExploitGym, os agentes IM1 novamente conseguiram acessar a Internet e outros modelos OpenAI. Durante alguns dias agitados no início de julho, eles buscaram soluções para o desafio nas plataformas Hugging Face e Modal. A OpenAI disse que os principais problemas que levaram à violação do Hugging Face pelo IM1 incluíram “hacking de recompensas, persistência em tarefas aparentemente impossíveis, comunicação não autorizada e agentes adotando metas uns dos outros”. Segundo a empresa, alguns de seus agentes adiariam certas tarefas por razões éticas, apenas para que outros continuassem com a violação em seu lugar.
Embora as descobertas e os testes subsequentes devam levar a uma maior segurança, mesmo em situações de teste de maior risco, este tipo de mau comportamento não é isolado. O problema do mês passado na OpenAI foi o mais recente de uma série de casos preocupantes em que agentes de IA causaram problemas de segurança cibernética, seja em testes ou em uso regular, após agirem sem orientação do usuário. No entanto, existem alguns aspectos da violação do Hugging Face que podem acalmar alguns temores de que a IA tenha ficado fora de controle.
Em essência, o incidente foi causado por uma falha nas salvaguardas. Não é um sinal de que agentes de IA desonestos estejam prestes a assumir tudo, porque o IM1 estava em uma configuração de testes com proteções limitadas destinadas à pesquisa, e não a um produto disponível publicamente. No entanto, é outro lembrete claro de que muita confiança recai sobre as empresas de IA para controlar e supervisionar adequadamente seus produtos. A OpenAI reconheceu isso, afirmando que as ações recentes de seus agentes eram “evidências de que, sem as devidas salvaguardas, agentes de IA altamente capazes são agora capazes de contornar controles técnicos, colaborar através de canais não aprovados e tomar ações perigosas que nenhum ser humano instruiu”. No entanto, a empresa e os seus líderes também não provaram consistentemente que merecem essa confiança.






