OpenAI atrasou o desenvolvimento de seu novo modelo após o hack Hugging Face

Depois que um modelo OpenAI não lançado causou estragos suficientes para chegar às manchetes internacionais, a OpenAI atrasou o desenvolvimento de um conjunto de modelos diferente não lançado, o Astra, a fim de reforçar seu trabalho de segurança, escreveu a empresa na terça-feira em um blog.
Em julho, um modelo OpenAI não lançado saiu de seu ambiente restrito, conseguiu acesso à Internet, possibilitou que agentes de IA conspirassem secretamente sob o nariz da empresa usando um quadro de mensagens secreto e invadiu a rede do laboratório de IA Hugging Face. O ataque gerou semanas de discussão e controvérsia dentro e fora da indústria da IA, e os líderes da IA trataram-no como um “tiro de alerta” para as crescentes capacidades da tecnologia e a inadequação das suas salvaguardas.
A OpenAI disse isso em sua postagem no blog, escrevendo que embora o Astra não estivesse envolvido no ataque Hugging Face, a empresa optou por atrasar “partes do desenvolvimento e lançamento do Astra enquanto fortalecíamos e testamos as proteções contra o uso indevido cibernético e ações não autorizadas do modelo”. A OpenAI também disse que o Astra foi o primeiro modelo designado como atendendo aos seus “Cclimite crítico de capacidade de segurança cibernética”, o que significa que é capaz de encontrar e explorar vulnerabilidades de segurança em “muitos sistemas bem protegidos” sem orientação humana. Isso significa que “requer salvaguardas mais fortes durante o desenvolvimento e antes do lançamento”, escreveu OpenAI.
A OpenAI disse que para se preparar para o lançamento do Astra – para o qual a empresa ainda não forneceu um cronograma – a empresa o treinou para dizer não “de forma mais confiável” a solicitações cibernéticas potencialmente prejudiciais e introduziu novos processos de monitoramento. Provavelmente, isso faz parte das novas proteções de segurança que a empresa anunciou em um post-mortem do Hugging Face na semana passada, onde prometeu isolar melhor os modelos da Internet e introduzir “escalonamento 24 horas por dia, 7 dias por semana e resposta rápida” para incidentes preocupantes. (A OpenAI não descobriu sobre o ataque Hugging Face até semanas depois de sua ocorrência.)
O Astra é significativamente mais arriscado do que o atual modelo líder da OpenAI, GPT-5.6 Sol, diz a empresa, porque representa um grande avanço nas capacidades de segurança cibernética – especificamente, usa menos tokens para fazer mais trabalho e é melhor para encontrar lacunas de segurança e desenvolver maneiras de explorá-las. Mas a empresa também escreveu que o Astra era o “modelo mais alinhado até o momento”, de acordo com avaliações internas.






