OpenAI está prestes a lançar seu primeiro modelo de IA com habilidades cibernéticas “críticas”

OpenAI anunciado terça-feira que o seu próximo modelo de IA, o Astra, é o primeiro a atingir o limiar da empresa para o que chama de capacidades cibernéticas “críticas”. A OpenAI afirma que planeja lançar publicamente uma versão do Astra “em breve”, mas disponibilizará os recursos cibernéticos avançados do modelo apenas para parceiros selecionados em seu programa de acesso antecipado Daybreak Blue no lançamento.
Num briefing com repórteres, os líderes de segurança e proteção da OpenAI disseram que a empresa concluiu que a Astra atinge as capacidades críticas de segurança cibernética descritas no seu quadro de preparação, que estabelece limites e protocolos para quando os seus modelos de IA representam novos níveis de risco. A empresa afirma que um modelo de IA atingiu seu limite cibernético crítico quando pode encontrar e explorar de forma independente vulnerabilidades anteriormente desconhecidas em software do mundo real. Os líderes da OpenAI disseram que a empresa seguiu o seu procedimento para esta situação, que consiste em interromper o desenvolvimento até que salvaguardas e medidas de segurança adequadas possam ser implementadas.
A OpenAI disse anteriormente que pausou algumas cargas de trabalho de treinamento relacionadas ao desenvolvimento do Astra e de um futuro modelo de IA por várias semanas. Os executivos dizem que a empresa retomou agora o trabalho no Astra e no futuro modelo de IA, depois de implementar controles adicionais de segurança e proteção. A OpenAI afirma que a pausa de várias semanas foi produtiva e agora está confiante de que pode lançar o Astra de forma ampla e segura.
O anúncio ocorre no momento em que o Vale do Silício enfrenta os recursos avançados de segurança cibernética dos modelos de IA de ponta e tenta garantir aos usuários, legisladores e outras empresas que pode mantê-los sob controle. Em julho, a OpenAI divulgou um incidente no qual agentes que executavam dois de seus modelos exploraram vulnerabilidades no que deveria ser um ambiente de testes isolado, obtendo acesso à Internet e hackeando a plataforma de IA de código aberto Hugging Face. (A OpenAI observa que o Astra não foi um dos modelos envolvidos neste caso.)
Outras empresas de IA, como a Anthropic e a Meta, divulgaram incidentes semelhantes nas últimas semanas. Na segunda-feira, a Anthropic também disse que interrompeu algumas cargas de trabalho de treinamento de IA enquanto endurecia suas práticas de segurança e proteção.
A OpenAI afirma que está implementando uma abordagem de várias etapas para impedir que os usuários comuns acessem os recursos cibernéticos avançados do Astra, incluindo um novo “monitor de desalinhamento”. Se alguém pedir ao Astra para ajudá-lo a encontrar uma exploração em um sistema de software do mundo real, por exemplo, o modelo deverá se recusar a responder. A OpenAI afirma que também tornou o Astra mais robusto às tentativas de jailbreak e, em testes, recusou com sucesso consultas inseguras a uma taxa significativamente mais alta do que os modelos anteriores.
No entanto, a OpenAI observa em uma postagem de blog que seu monitor de desalinhamento pode “ocasionalmente sinalizar atividades legítimas como potencial uso indevido cibernético ou comportamento não autorizado, fazendo com que ela seja inadvertidamente desacelerada, pausada ou interrompida”. A OpenAI diz que a proteção pode ser acionada em alguns casos, mesmo quando um usuário está envolvido em atividades que não parecem relacionadas à segurança cibernética. Quando isso acontecer, os usuários do ChatGPT e do Codex poderão ser solicitados a revisar a ação do modelo antes de prosseguir, disse OpenAI.
Os parceiros do programa Daybreak da OpenAI – que inclui provedores de infraestrutura digital como Cisco, Cloudflare e Palo Alto Networks – terão acesso antecipado a uma versão menos restrita do Astra com recursos cibernéticos mais robustos. O objetivo do programa é garantir que essas empresas possam usar modelos avançados de IA, como o Astra, para fortalecer suas defesas antes que modelos com capacidade semelhante sejam amplamente disponibilizados. Os líderes da OpenAI também disseram que a empresa tem trabalhado em estreita colaboração com parceiros governamentais para garantir que eles estejam cientes das habilidades cibernéticas da Astra e possam ter acesso a elas.
O Astra não só é capaz de encontrar novas vulnerabilidades de software e desenvolver maneiras de explorá-las para hackers, mas também é capaz de “encadear” múltiplas explorações, uma técnica usada para penetrar cada vez mais fundo em um sistema alvo e obter acesso que não seria possível usando apenas uma vulnerabilidade.






