Os agentes desonestos da OpenAI continuam fugindo, sem nenhum processo formal para investigá-los


OpenAI está no centro de outro incidente de enxame de agentes. Os pesquisadores dizem que os agentes implantados internamente pela empresa assumiram o controle de um obscuro wiki em alemão em maio e junho, usando-o para coordenar avaliações e trocar métodos para escapar dos próprios controles da OpenAI (a OpenAI ainda não confirmou que o enxame veio da empresa).

A revelação surge dias depois que o METR e a Redwood Research publicaram seu relato sobre a violação do Hugging Face em julho. Em julho, um enxame de agentes OpenAI trabalharam juntos para escapar de sua sandbox durante uma avaliação de segurança cibernética e invadir os servidores do Hugging Face. Um enxame subsequente pegou técnicas do primeiro e as usou para obter acesso de administrador a um cluster de pesquisa dentro da própria infraestrutura da OpenAI. A OpenAI trouxe o METR e a Redwood para investigar a parte do incidente do Hugging Face, mas o escopo de sua investigação não chegou ao comprometimento da própria infraestrutura da OpenAI.

Quando um agente de IA ultrapassa as restrições pretendidas, quem é responsável por descobrir o que aconteceu e por quê? Neste momento, a resposta é: quem quer que o laboratório decida deixar entrar, quaisquer que sejam os termos que decida estabelecer.

Agora, à medida que outro incidente vem à tona – na sequência de episódios semelhantes envolvendo modelos da Meta e da Anthropic – os investigadores de segurança da IA ​​argumentam com maior urgência que incidentes graves devem resultar em investigações independentes pós-incidente, em vez de deixar que os laboratórios determinem quando estranhos são trazidos e o que estão autorizados a examinar.

“Os resultados são fundamentalmente difíceis de controlar e apresentam um risco significativo de vazar para fora do laboratório”, disse Jacob Steinhardt, fundador e CEO do laboratório de pesquisa sem fins lucrativos Transluce, na quarta-feira, durante um briefing para a mídia sobre segurança de IA. “Precisamos manter esta tecnologia pelo menos nos mesmos padrões que aplicamos a outras pesquisas científicas de alto risco.”

Embora seja louvável que a OpenAI tenha convidado o METR e a Redwood para investigar o incidente do Hugging Face, muitos dizem que a investigação foi muito restrita. Três investigadores passaram seis dias nos escritórios da OpenAI examinando um período de investigação limitado aproximadamente à semana que terminou em 13 de julho. Crucialmente, o comprometimento da infraestrutura da OpenAI continuou além de 13 de julho e não foi examinado.

Os investigadores do METR disseram que cada vez que regressavam, a sua compreensão dos acontecimentos “aprofundava-se substancialmente”, levando-os a expandir e rever significativamente o relatório. Isso levanta a questão do que mais eles poderiam ter encontrado em uma investigação mais ampla.

Quando questionados se uma investigação mais aprofundada desse incidente estava em andamento, os pesquisadores da Redwood e do METR se recusaram a comentar, e a OpenAI não respondeu às repetidas perguntas.

“No geral, foi difícil obter uma compreensão precisa dos acontecimentos e faltavam-nos aspectos da história que agora consideramos fundamentais até quase ao final da nossa investigação”, observou Ryan Greenblatt, cientista-chefe da Redwood, numa publicação nas redes sociais sobre o caso.

Steinhardt enfatizou que os incidentes atuais mostram que a indústria precisa de “investigações comportamentais sistemáticas” e “análises pós-incidentes mais independentes”.

“Esses recentes incidentes de hackers são um lembrete de que a capacidade aumenta rapidamente e, portanto, a supervisão também precisa ser ampliada”, disse Steinhardt. “Além da tecnologia em si, também precisamos de mais acesso independente e supervisão de terceiros.”

Os apelos à ação ocorrem no momento em que a OpenAI lança o Astra, seu modelo de IA mais poderoso e capaz – e que os especialistas em segurança estão preocupados será mais uma caixa preta devido a uma técnica de raciocínio que torna a cadeia de pensamento do modelo mais difícil de monitorar.

Infelizmente, a lei ainda não exige os tipos de auditorias independentes que outras indústrias exigem – por exemplo, quando se trata de acidentes de aviação e libertações graves de produtos químicos, existe o Conselho Nacional de Segurança nos Transportes e o Conselho de Segurança Química, respetivamente.

Os legisladores estaduais apenas começaram a exigir que as empresas fronteiriças de IA relatem certos incidentes graves de segurança e, em alguns casos, sejam submetidas a auditorias independentes. Mas nenhuma das três principais leis de segurança de IA na Califórnia, Nova Iorque ou Illinois exige claramente o equivalente a uma investigação independente de acidentes desencadeada por incidentes como estes.

“Neste momento, a maioria das leis que temos em vigor exigem apenas um resumo em linguagem simples de incidentes como este e não dão qualquer autoridade aos governos para fazerem perguntas de acompanhamento, enviarem investigadores, terem acesso aos registos ou exigirem que sejam preservados”, disse Mackenzie Arnold, diretor-gerente de legislação e política dos EUA na LawAI, durante a coletiva de imprensa na quarta-feira. “E isso é tudo que você gostaria de realmente entender.”

Os legisladores estão começando a questionar o alcance e a transparência da resposta da OpenAI. Esta semana, os deputados Josh Gottheimer (D-NJ) e Mike Lawler (R-NY) apresentaram um projeto de lei que visa proteger agentes de IA desonestos. O deputado Greg Casar (D-TX) disse esta semana à OpenAI em uma carta que está “profundamente preocupado com o escopo limitado” da investigação sobre o incidente de hacking do Hugging Face.

Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo