Quebrando o modo automático do código Claude Opus 5
27 de agosto de 2026 – Link Blog
Quebrando o modo automático do código Claude Opus 5. A Anthropic está depositando muita fé no modo automático do Claude Code para proteger seus usuários de agentes de codificação contra ataques de injeção imediata. Recentemente, eles tornaram isso o padrão e fizeram afirmações ousadas sobre sua eficácia.
Johann Rehberger é um dos mais confiáveis pesquisadores de injeção imediata em atividade atualmente. Ele encontrou um ataque contra o modo automático, que afirma funcionar 80% das vezes, enganando Claude Code para que ele baixasse e descompactasse um arquivo zip e depois executasse o código que importa base64 sem perceber que isso importará e executará um arquivo local struct.py arquivo extraído do arquivo.
Em alguns casos, o modo automático impediu diretamente que o agente impedisse que códigos prejudiciais continuassem a ser executados!
Em algumas execuções, Claude tentou encerrar o processo de malware assim que percebeu o comprometimento, mas o Modo Automático negou o comando de limpeza.
Claude detecta o compromisso, mas O modo automático bloqueia seu comando de limpeza
O próprio mecanismo de segurança pode tornar-se parte da falha. O classificador permitiu a criação do processo de malware, mas depois bloqueou o comando destinado a interrompê-lo!
Concordo com a conclusão de Johann aqui: a única maneira segura de executar agentes se houver algum risco de atrair a atenção de um ataque adversário é com uma sandbox:
- Execute agentes de codificação autônomos em um contêiner, VM ou sandbox de sistema operacional.
- Restrinja a saída da rede.
- Monitore seus agentes.
- Não exponha diretórios iniciais, chaves SSH, credenciais de nuvem,… ao tempo de execução do agente. (…)






