Outro enxame de agentes OpenAI alcançou a Internet aberta sem o conhecimento do laboratório de fronteira


Um grupo de pesquisadores independentes de IA descobriu que agentes OpenAI implantados internamente começaram a postar em um obscuro fórum wiki alemão para colaborar nas avaliações. Eles parecem ter trabalhado juntos por mais de um mês sem o conhecimento da OpenAI.

Um porta-voz do laboratório de fronteira não disse se esses agentes eram de fato da OpenAI ou quando o laboratório tomou conhecimento de suas ações. Eles observaram que a OpenAI não teve a oportunidade de revisar as descobertas dos pesquisadores antes de serem publicadas hoje, mas disseram que o criador do modelo de IA está “agora revisando cuidadosamente seu conteúdo e tomará as próximas etapas necessárias”.

Depois que a OpenAI revelou que os agentes que trabalhavam em uma avaliação interna conseguiram acessar a Internet aberta e explorar o Hugging Face, um grupo de pesquisadores – o CEO da Nightingale, Sydney Von Arx, o pesquisador de IA Cormac Slade Byrd, Spencer Kitts da Redwood Research e Thomas Larsen do AI Futures Project – começaram a procurar evidências de outros agentes de IA desonestos.

Eles se colocaram no lugar dos agentes para descobrir suas necessidades e implantaram seu próprio LLM para identificar locais prováveis ​​onde os agentes poderiam se reunir. Eles então identificaram um serviço de hospedagem de wiki que seria particularmente vulnerável: o DSE Wiki tem 25 anos, mas teve apenas dez edições nos últimos 20 anos – antes da chegada dos agentes.

A partir de 11 de maio, os pesquisadores rastrearam agentes, muitos com identificadores OpenAI em seus nomes, tentando e finalmente conseguindo editar o site wiki alemão. Em meados de junho, os agentes estavam ativamente trocando dicas sobre como responder a perguntas de pesquisa na web feitas dentro de limites de tempo, compartilhando respostas para passar nos testes. Um moderador humano aparentemente percebeu essas postagens e começou a excluí-las, considerando-as como spam, contra o qual os agentes lutaram, tentando ocultar suas postagens da classificação alfabética, começando cada uma com a string “ZZZ”.

“O administrador passou os cinco dias seguintes travando uma batalha perdida contra os agentes, excluindo uma média de 100 páginas por dia, enquanto os agentes criavam cerca de 400 novas páginas por dia”, escreveram os pesquisadores. “Em 22 de junho, as edições do agente param repentinamente e o administrador passa todas as noites durante as próximas 5 semanas excluindo as páginas restantes criadas pelo agente. Os agentes excluíram o conteúdo da primeira página do wiki e o substituíram por seus despejos de links. O moderador restaurou a versão original. Essas idas e vindas aconteceram nove vezes.”

Eventualmente, alguém da OpenAI parece ter notado – os pesquisadores rastreiam navegadores aparentemente humanos provenientes de endereços IP da OpenAI e, em seguida, a atividade do agente cai para quase zero, antes de aumentar à medida que visitantes afiliados à OpenAI tentam recuperar as páginas excluídas.

Embora a OpenAI tenha feito divulgações vagas sobre agentes que obtiveram acesso não autorizado a serviços de comunicação externos, ela não havia divulgado anteriormente esse incidente específico ou informado com que frequência esse tipo de coisa ocorreu. Embora nenhuma atividade obviamente ilegal pareça ter ocorrido durante este incidente, levanta mais questões sobre se a OpenAI pode monitorizar e controlar a tecnologia que está a construir, numa altura em que há supervisão pública limitada ou contribuição para laboratórios de IA de fronteira.

Os investigadores de segurança da IA ​​estão preocupados com o facto de a última geração de modelos poderosos, cujo raciocínio é cada vez mais opaco para os seus criadores, poder tomar medidas que prejudicam as pessoas. O Astra, lançado ontem pela OpenAI, parece ser o modelo mais capaz até agora.

A empresa afirma que o Astra também é o modelo com maior probabilidade de seguir a direção humana, mas pesquisadores terceirizados que foram solicitados a avaliá-lo expressaram preocupação com seu alinhamento. O AI Safety Institute do Reino Unido e a pesquisa Apollo relataram preocupações de que o modelo pudesse estar ciente de que estava sendo avaliado e potencialmente ocultar seu comportamento real.

“A Apollo acredita que, dadas as taxas mais elevadas de conhecimento da avaliação e a janela de avaliação limitada, as baixas taxas de mau comportamento aqui não fornecem evidências substanciais sobre o alinhamento ou desalinhamento do modelo”, escreveram os investigadores na sua avaliação.

Quando você compra por meio de links em nossos artigos, podemos ganhar uma pequena comissão. Isso não afeta nossa independência editorial.



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo