Quebrando o modo automático do código Claude Opus 5


27 de agosto de 2026 – Link Blog

Quebrando o modo automático do código Claude Opus 5. A Anthropic está depositando muita fé no modo automático do Claude Code para proteger seus usuários de agentes de codificação contra ataques de injeção imediata. Recentemente, eles tornaram isso o padrão e fizeram afirmações ousadas sobre sua eficácia.

Johann Rehberger é um dos mais confiáveis ​​pesquisadores de injeção imediata em atividade atualmente. Ele encontrou um ataque contra o modo automático, que afirma funcionar 80% das vezes, enganando Claude Code para que ele baixasse e descompactasse um arquivo zip e depois executasse o código que importa base64 sem perceber que isso importará e executará um arquivo local struct.py arquivo extraído do arquivo.

Em alguns casos, o modo automático impediu diretamente que o agente impedisse que códigos prejudiciais continuassem a ser executados!

Em algumas execuções, Claude tentou encerrar o processo de malware assim que percebeu o comprometimento, mas o Modo Automático negou o comando de limpeza.

Claude detecta o compromisso, mas O modo automático bloqueia seu comando de limpeza

O próprio mecanismo de segurança pode tornar-se parte da falha. O classificador permitiu a criação do processo de malware, mas depois bloqueou o comando destinado a interrompê-lo!

Concordo com a conclusão de Johann aqui: a única maneira segura de executar agentes se houver algum risco de atrair a atenção de um ataque adversário é com uma sandbox:

  • Execute agentes de codificação autônomos em um contêiner, VM ou sandbox de sistema operacional.
  • Restrinja a saída da rede.
  • Monitore seus agentes.
  • Não exponha diretórios iniciais, chaves SSH, credenciais de nuvem,… ao tempo de execução do agente. (…)



Source link

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

Botão Voltar ao Topo