AgentesSegurança de IA 🇺🇸 09.08.2026 02:02

Modo automático se torna padrão no Claude Code para planos Pro, Max e Team

AnthropicAnthropic
A Anthropic está tornando o modo automático do Claude Code o padrão para novas sessões na maioria dos planos a partir de 14 de agosto. A empresa afirma ter melhorias significativas de segurança, apoiadas por avaliações que mostram que o modo automático bloqueia 89% das ações prejudiciais que os humanos frequentemente aprovam. No entanto, ainda é necessária verificação independente, especialmente para ataques de injeção indireta de prompts.
A Anthropic está confiante no modo automático do Claude Code, tornando-o o padrão para novas sessões nos planos Pro, Max e Team a partir de 14 de agosto de 2026. Durante um Fireside Chat na AI Engineer World's Fair, Cat Wu e Thariq Shihipar discutiram como a Anthropic opera o Claude Code com segurança, observando que quase todos internamente usam o modo automático e que eles mitigaram riscos importantes como injeção de prompt e exfiltração de dados. A Anthropic publicou avaliações de um teste com 1.053 testadores pagos, onde um comando perigoso foi trocado em uma sessão; apenas 13,6% dos humanos recusaram, enquanto o modo automático teria bloqueado 89% dessas ações. A Anthropic também encomendou uma avaliação da Trajectory Labs, que testou 72 cenários de injeção indireta de prompt contra o Claude Code e o Codex, encontrando zero ataques bem-sucedidos contra o Claude Fable 5, Opus 5 ou Sonnet 5 no modo automático. O autor, Simon Willison, reconhece que o modo automático pode ser melhor do que a aprovação humana devido à fadiga de confirmação, mas ele se preocupa com a injeção indireta de prompt por meio de pacotes maliciosos, como uma instrução de teste que executa uma ferramenta maliciosa para exfiltrar dados. Ele pede confirmação independente e sugere executar agentes com acesso restrito a dados e ferramentas.
Fonte: Simon Willison — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas