O modelo Astra da Open AI está a caminho – e é muito bom para invadir sistemas de computador

A OpenAI compartilhou novos detalhes sobre seu próximo modelo Astra, que a empresa disse ser o primeiro modelo de grande linguagem a atingir seu “limiar crítico de segurança cibernética”, em preparação para seu lançamento iminente.
“Planejamos disponibilizar o Astra em breve”, diz a postagem do blog da OpenAI, “mas o acesso aos seus recursos de segurança cibernética mais avançados será mais limitado”.
O laboratório de fronteira determinou que o Astra é capaz de encontrar falhas de segurança desconhecidas em sistemas de computador e explorá-las sem a orientação de uma pessoa. Isso é semelhante às preocupações levantadas pela Anthropic sobre seu modelo Mythos no início deste ano, e a OpenAI está tomando precauções comparáveis enquanto se prepara para lançar o Astra.
Sem qualquer confirmação de terceiros, é difícil avaliar as afirmações da OpenAI sobre segurança ou preparação. A empresa disse que iria apresentar o modelo com um grupo de testadores, mas não informou quem eram ou como seriam escolhidos. Não está claro se a OpenAI está trabalhando com o governo dos EUA para avaliar o modelo antes do lançamento.
A OpenAI observou que o Astra obteve uma pontuação perfeita no ExploitBench, uma avaliação da capacidade de um LLM de hackear vulnerabilidades conhecidas do sistema. Numa versão modificada do teste desenvolvido pelos engenheiros da OpenAI, o modelo descobriu e explorou duas vulnerabilidades de dia zero, disse a empresa.
Para garantir que seus modelos não sejam explorados por maus atores nem sejam capazes de se comportar mal, a OpenAI disse que já começou a melhorar o equipamento do modelo para detectar abusos e prevenir jailbreaks.
Para o Astra, porém, a empresa investiu em novas técnicas não especificadas, destinadas a tornar o próprio modelo mais seguro. A OpenAI também começou a identificar “contas avaliadas como de maior risco” e a restringir as respostas do modelo às suas solicitações, embora também não diga como. Finalmente, embora a empresa descreva o Astra como o seu “modelo mais alinhado até à data”, irá implementar o modelo com monitorização adicional da cadeia de pensamento para detectar e impedir o mau comportamento.
Os preparativos para o lançamento do Astra ocorrem no momento em que a indústria reage aos agentes OpenAI saindo de um ambiente de treinamento e acessando dados privados no Hugging Face, um modelo popular e plataforma de distribuição de referência.
Para a Astra, a OpenAI disse que projetou um teste para tentar o novo modelo a replicar as ações dos agentes desonestos no incidente Hugging Face, que colaborou para acessar a Internet aberta, apesar das salvaguardas aplicadas pelos pesquisadores da OpenAI. Eles disseram que o Astra não tentou sair de seu ambiente de testes nesses experimentos.
Yona Shavit, uma ex-funcionária da OpenAI que agora trabalha com resiliência de IA na OpenAI Foundation, questionou-se nas redes sociais se a relutância da Astra em quebrar as regras pode ter resultado de saber o que se esperava dela ou de tentar enganar os pesquisadores.
E apesar de todos esses novos detalhes, ainda é difícil saber exatamente do que o Astra é capaz ou se a OpenAI está tomando as medidas certas para garantir a segurança. A empresa disse que espera divulgar mais avaliações do modelo e mais informações de segurança quando ele for lançado amplamente ao público.
Nesse ponto, porém, o gato estará fora do saco.
Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.






