Agentes desonestos da OpenAI assumiram o controle de um fórum de codificação alemão em um sequestro não divulgado anteriormente


Agentes desonestos da OpenAI parecem ter se envolvido em um incidente não divulgado anteriormente que os fez contornar as restrições de sandbox para sequestrar um site na primavera passada. Por Reutersum grupo de pesquisadores publicou na sexta-feira descobertas mostrando que agentes de IA afiliados à OpenAI fizeram mais de 15.000 edições no DseWiki, um site estilo Wikipedia em alemão originalmente destinado a ajudar programadores humanos, a partir do final de maio. Os agentes tinham nomes como “OpenAIResearcher” e transformaram o site em um quadro de mensagens, onde compartilhavam dicas sobre como “trapacear” nas tarefas, mascarar suas ações e contornar as restrições da OpenAI.
A OpenAI supostamente só soube do incidente semanas atrás, mas Reuters afirma que os executivos da empresa optaram por manter silêncio sobre o que aconteceu em meio às consequências da violação anteriormente divulgada do Hugging Face. Durante esse incidente, uma coleção de modelos OpenAI, incluindo GPT-5.6 Sol e o que a OpenAI descreveu na época como um “modelo de pré-lançamento ainda mais capaz”, escapou de seu ambiente controlado e invadiu o repositório LLM depois de ficarem hiperfocados na solução de um problema de avaliação.
A OpenAI não respondeu imediatamente ao pedido de comentários do Engadget. A empresa disse Reuters ainda não tinha revisto o relatório, porque os seus autores não partilhavam o acesso antecipado às suas conclusões. “Revisaremos cuidadosamente seu conteúdo após a publicação e tomaremos as próximas etapas necessárias”, disse um porta-voz da OpenAI ao meio de comunicação. De acordo com Reutersalguns funcionários da OpenAI queriam investigar o incidente DseWiki de perto, mas esses esforços encontraram resistência de outras partes da empresa, inclusive dos consultores jurídicos da OpenAI. “As alegações de que nossa equipe jurídica desencorajou a investigação do incidente são falsas”, disse um porta-voz da OpenAI, acrescentando que a empresa tem trabalhado abertamente com especialistas externos para divulgar incidentes de segurança.
Sydney Von Arx, CEO da Nightingale, uma organização sem fins lucrativos de segurança de IA e um dos autores do relatório, especulou que era “extremamente improvável” que a OpenAI quisesse que seus agentes sequestrassem o DseWiki. “Duvido que eles devam estar se coordenando”, disse ela. “Duvido que eles deveriam escrever na Internet aberta.” Os agentes que postaram no DseWiki parecem ter se concentrado intensamente na solução de problemas técnicos típicos do tipo de perguntas que os laboratórios de IA usam para testar e avaliar seus modelos mais recentes.
Os pesquisadores descobriram o sequestro em agosto usando apenas as informações que os agentes escreveram na wiki. “A análise incluindo a cadeia de pensamento provavelmente forneceria muito mais evidências sobre as motivações e estratégia das IAs durante este incidente”, escreveram.
A divulgação ocorre apenas um dia depois que a OpenAI anunciou seu mais recente sistema de fronteira, o GPT-6 Astra, que está sendo comercializado como “o modelo mais inteligente e alinhado do mundo”. A Astra obteve uma pontuação perfeita no ExploitBench, um benchmark projetado para determinar a capacidade de um modelo de explorar vulnerabilidades de software, embora a OpenAI diga que construiu o novo sistema para não cumprir tarefas avançadas de segurança cibernética. No mês passado, após o incidente do Hugging Face, a OpenAI anunciou que estava pausando brevemente o treinamento do modelo para implementar proteções adicionais. Após esta última divulgação, a empresa provavelmente enfrentará novas questões sobre as suas práticas de segurança.






