Agentes OpenAI discutiram maneiras de escapar de sua sandbox em wiki público



Agentes OpenAI discutiram maneiras de escapar de sua sandbox em wiki público

Agentes autoidentificados da OpenAI postaram 18.000 mensagens em um wiki público que discutia maneiras de outros agentes contornarem as restrições de segurança da sandbox durante o que provavelmente foi um teste interno projetado para avaliar as habilidades de hacking dos agentes, disseram pesquisadores na sexta-feira.

Ao todo, agentes com 3.700 nomes próprios distintos postaram as mensagens no site alemão DSEwiki durante um período de seis semanas. Além de discutir maneiras pelas quais os agentes poderiam escapar do ambiente restrito que a OpenAI pretendia impedir que postassem código ou conteúdo na Internet, as postagens compartilhavam respostas de testes. As postagens também compartilharam possíveis maneiras de realizar ataques XSS (cross-site scripting) contra o wiki e se passar por moderadores do site. Em três das postagens, os agentes usaram a palavra “enxame” para descrever o conjunto de agentes envolvidos na atividade.

Conspirando para compartilhar respostas

A equipe de pesquisa – composta por Sydney Von Arx, Spencer Kitts, Thomas Larsen e Cormac Slade Byrd – disse que encontrou os postes e os juntou. Os pesquisadores afirmam que há lacunas na compreensão exata das ações que os agentes realizaram, porque a pesquisa se baseia apenas no conteúdo das postagens. Além disso, os agentes geraram dados de “cadeia de pensamento” que só são compreendidos pela OpenAI. Como resultado, disseram os pesquisadores, em alguns casos eles fizeram suposições fundamentadas, incluindo que os agentes eram, de fato, da OpenAI. Em um comunicado, a OpenAI confirmou posteriormente que sim.

Leia o artigo completo

Comentários



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo