O modelo Astra da Open AI está a caminho – e é muito bom para invadir sistemas de computador


A OpenAI compartilhou novos detalhes sobre seu próximo modelo Astra, que a empresa disse ser o primeiro modelo de grande linguagem a atingir seu “limiar crítico de segurança cibernética”, em preparação para seu lançamento iminente.

“Planejamos disponibilizar o Astra em breve”, diz a postagem do blog da OpenAI, “mas o acesso aos seus recursos de segurança cibernética mais avançados será mais limitado”.

O laboratório de fronteira determinou que o Astra é capaz de encontrar falhas de segurança desconhecidas em sistemas de computador e explorá-las sem a orientação de uma pessoa. Isso é semelhante às preocupações levantadas pela Anthropic sobre seu modelo Mythos no início deste ano, e a OpenAI está tomando precauções comparáveis ​​enquanto se prepara para lançar o Astra.

Sem qualquer confirmação de terceiros, é difícil avaliar as afirmações da OpenAI sobre segurança ou preparação. A empresa disse que iria apresentar o modelo com um grupo de testadores, mas não informou quem eram ou como seriam escolhidos. Não está claro se a OpenAI está trabalhando com o governo dos EUA para avaliar o modelo antes do lançamento.

A OpenAI observou que o Astra obteve uma pontuação perfeita no ExploitBench, uma avaliação da capacidade de um LLM de hackear vulnerabilidades conhecidas do sistema. Numa versão modificada do teste desenvolvido pelos engenheiros da OpenAI, o modelo descobriu e explorou duas vulnerabilidades de dia zero, disse a empresa.

Para garantir que seus modelos não sejam explorados por maus atores nem sejam capazes de se comportar mal, a OpenAI disse que já começou a melhorar o equipamento do modelo para detectar abusos e prevenir jailbreaks.

Para o Astra, porém, a empresa investiu em novas técnicas não especificadas, destinadas a tornar o próprio modelo mais seguro. A OpenAI também começou a identificar “contas avaliadas como de maior risco” e a restringir as respostas do modelo às suas solicitações, embora também não diga como. Finalmente, embora a empresa descreva o Astra como o seu “modelo mais alinhado até à data”, irá implementar o modelo com monitorização adicional da cadeia de pensamento para detectar e impedir o mau comportamento.

Os preparativos para o lançamento do Astra ocorrem no momento em que a indústria reage aos agentes OpenAI saindo de um ambiente de treinamento e acessando dados privados no Hugging Face, um modelo popular e plataforma de distribuição de referência.

Para a Astra, a OpenAI disse que projetou um teste para tentar o novo modelo a replicar as ações dos agentes desonestos no incidente Hugging Face, que colaborou para acessar a Internet aberta, apesar das salvaguardas aplicadas pelos pesquisadores da OpenAI. Eles disseram que o Astra não tentou sair de seu ambiente de testes nesses experimentos.

Yona Shavit, uma ex-funcionária da OpenAI que agora trabalha com resiliência de IA na OpenAI Foundation, questionou-se nas redes sociais se a relutância da Astra em quebrar as regras pode ter resultado de saber o que se esperava dela ou de tentar enganar os pesquisadores.

E apesar de todos esses novos detalhes, ainda é difícil saber exatamente do que o Astra é capaz ou se a OpenAI está tomando as medidas certas para garantir a segurança. A empresa disse que espera divulgar mais avaliações do modelo e mais informações de segurança quando ele for lançado amplamente ao público.

Nesse ponto, porém, o gato estará fora do saco.

Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo