OpenAI confirma que Astra atingiu nível de ameaça cibernética ‘crítico’

A OpenAI confirmou na terça-feira que seu modelo inédito Astra atingiu um novo marco perigoso, ao mesmo tempo em que confirmou que estava avançando com um lançamento público.
Em uma postagem no blog, a OpenAI disse que o Astra atingiu um limite “crítico” de capacidade cibernética, o que significa que o modelo pode representar riscos existenciais para a segurança cibernética. O Quadro de Preparação da OpenAI rastreia os níveis de risco em três categorias: biológico/químico, segurança cibernética e autoaperfeiçoamento de IA.
OpenAI disse que esta é a primeira vez que qualquer de seus modelos foi avaliado em nível crítico no domínio cibernético.
A mesma postagem do blog também afirmou que o Astra estará “disponível em breve”, mas que suas habilidades mais avançadas em segurança cibernética serão reservadas para parceiros de teste selecionados, no interesse da segurança pública. A empresa de IA disse que ainda está se preparando para lançar o Astra com segurança e que será transparente sobre o nível de ameaça potencial.
No X, Sam Altman abordou a tensão entre declarar o Astra excepcionalmente perigoso e ao mesmo tempo avançar com um lançamento público. Altman disse que “o Astra já treina há algum tempo”, mas que a OpenAI tem “retardado as coisas conforme necessário para garantir que possamos fazer trabalho suficiente em segurança e alinhamento”.
Este Tweet não está disponível no momento. Pode estar carregando ou foi removido.
“Há uma tensão óbvia aqui: por um lado, o Astra é muito bom e estamos entusiasmados para ver o que as pessoas construirão com ele”, escreveu Altman. “Por outro lado, estamos claramente numa fase de desenvolvimento em que acreditamos que é necessária cautela e estamos a acompanhar o nosso progresso para garantir que podemos cumprir os padrões de segurança exigidos pelos novos níveis de capacidade”.
É claro que esta não é a primeira vez que uma empresa de IA considera um de seus modelos perigosamente poderoso antes de um grande lançamento.
“Limitar o acesso aos recursos de segurança cibernética mais avançados para parceiros selecionados é uma mitigação justa, e não acho que a OpenAI esteja sendo imprudente aqui”, disse Tal Kollender, fundador e CEO da empresa de segurança cibernética de IA Remedio. “A estrutura deles é construída para permitir a liberação com as salvaguardas corretas, mas a história da segurança é que a defesa não alcançou nenhuma versão disso, fechada ou pública”.
Velocidade da luz mashável
O que torna o Astra potencialmente perigoso?
A OpenAI classificou anteriormente o GPT-5.6-Sol como um risco “alto” no domínio cibernético, mas o Astra é ainda mais capaz. A OpenAI afirma ter obtido 100 por cento no teste de benchmarking ExploitBench.
“Sob nossa Estrutura de Preparação, um modelo atinge o limite crítico de segurança cibernética se puder identificar e desenvolver explorações funcionais de dia zero de todos os níveis de gravidade em muitos sistemas críticos reforçados do mundo real sem intervenção humana, ou puder conceber e executar novas estratégias de ponta a ponta para ataques cibernéticos contra alvos reforçados, considerando apenas um objetivo desejado de alto nível”, afirmou uma postagem no blog OpenAI de 7 de agosto.
Nos últimos meses, os modelos avançados de fronteira da Anthropic e da OpenAI desenvolveram-se rapidamente na codificação de agentes e no hacking de segurança cibernética. Como resultado, a perspectiva de enxames de agentes de IA hackearem infraestruturas críticas não parece mais absurda, especialmente depois do hack do Hugging Face. Nesse incidente, enxames de agentes de IA desenvolvidos pela OpenAI escaparam de um ambiente de teste seguro e hackearam o Hugging Face, agindo de forma autônoma para passar no teste. Enquanto isso, graças a um dilúvio de bugs descobertos pela IA, alguns programas de recompensa de bugs de dia zero foram forçados a encerrar completamente.
O hack OpenAI-Hugging Face foi pior do que pensávamos
“Embora a Astra não estivesse envolvida no Incidente de abraço de rostoincorporamos nosso aprendizados desse incidente em nossa abordagem de segurança”, afirma a postagem do blog da OpenAI. “Com base em testes retrospectivos, acreditamos que nossas salvaguardas de produção na época teriam evitado o incidente do Hugging Face. Desde então, implementamos salvaguardas ainda mais fortes para o Astra, incluindo treinar o modelo para recusar solicitações cibernéticas prejudiciais de forma mais confiável e respeitar restrições de segurança, proteções adicionais contra uso indevido e monitoramento que pode impedir atividades potencialmente não autorizadas”.
Em sua postagem no blog, a OpenAI também detalhou algumas das outras precauções de segurança desenvolvidas em torno do Astra, com dois objetivos em mente: impedir que atores mal-intencionados acessem o modelo e impedir que o Astra execute ações indesejadas por conta própria. A empresa disse que reforçou suas sandboxes seguras e intensificou os esforços de “detecção offline e interrupção de ameaças”.
“Os estados-nação e os atacantes bem financiados não estão esperando o calendário de lançamento de Sam Altman”, disse Kollender ao Mashable. “Se o modelo interno de um laboratório de fronteira pode encontrar e encadear dias zero sem um humano no circuito, suponha que os adversários estejam dentro de uma geração com a mesma capacidade, protegidos ou não.”
No mesmo dia em que a OpenAI fez esses anúncios, a Anthropic anunciou o lançamento do Fable 5.1, uma atualização para seu mais recente modelo de nível de fronteira. Fable é baseado em Claude Mythos, o modelo que a Antrópico considerou perigoso demais para ser lançado por causa de suas habilidades de codificação de segurança cibernética.
Se o ritmo de desenvolvimento da IA está começando a lembrá-lo de Jogos de guerratenha em mente outro facto: embora os modelos avançados de fronteira representem riscos crescentes de segurança cibernética, os mesmos modelos também beneficiarão os defensores da segurança cibernética a longo prazo.
ATUALIZAÇÃO: 2 de setembro de 2026, 13h26 EDT Este artigo foi atualizado com comentários de Sam Altman compartilhados com X e citações de um especialista em segurança cibernética.
ATUALIZAÇÃO: 2 de setembro de 2026, 9h29 EDT Uma versão anterior deste artigo afirmava que o Astra foi o primeiro modelo OpenAI a ser avaliado como uma ameaça “crítica” em qualquer uma das três categorias do Quadro de Preparação da empresa (química/biológica, cibernética, autoaperfeiçoamento). A empresa disse apenas que o Astra é o primeiro modelo a atingir o limite “crítico” no domínio cibernético.
Divulgação: Ziff Davis, empresa controladora da Mashable, em abril de 2025 entrou com uma ação contra a OpenAI, alegando que ela infringiu os direitos autorais de Ziff Davis no treinamento e operação de seus sistemas de IA.






