Segurança de IAAgentes 🇨🇳 10.08.2026 09:01

Claude Code muda para modo automático por padrão em 5 dias, Anthropic cobre custos extras

AnthropicAnthropic OpenAIOpenAI
A Anthropic tornará o modo automático o padrão do Claude Code em cinco dias, citando baixas taxas de rejeição das aprovações manuais de permissão e melhor desempenho de segurança do classificador. O custo extra de tokens por chamada de ferramenta no modo automático não será cobrado dos usuários. Plataformas de nuvem como Amazon, Google e Microsoft têm um mês para mudar para o modo automático por padrão.
A Anthropic vai habilitar o modo automático como padrão para todas as instalações do Claude Code em cinco dias, depois de descobrir que apenas 3% das solicitações de permissão são rejeitadas pelos usuários. O classificador do modo automático consome um pequeno número extra de tokens por chamada de ferramenta, mas a Anthropic não vai repassar esse custo aos usuários. Plataformas de nuvem como Amazon, Google e Microsoft, que atualmente oferecem o modo automático como uma opção, devem mudar para o modo automático padrão dentro de um mês. A equipe interna da Anthropic já usa exclusivamente o modo automático, segundo o 'pai do Claude Code'. A Anthropic justifica a mudança com dados: a aprovação manual tornou-se habitual, com uma taxa de aceitação de 97% para os prompts de permissão, enquanto a taxa de rejeição para solicitações de permissão individuais é de apenas 3%. Em um experimento controlado com 1053 testadores pagos, os participantes humanos interceptaram um comando claramente perigoso 13,6% das vezes, enquanto o modo automático o interceptou 89% das vezes; o modo automático bloqueou 800 comandos que os humanos permitiram, enquanto os humanos bloquearam apenas 6 comandos que o modo automático permitiu. O desempenho humano diminuiu com a duração da sessão, caindo de cerca de 17% no início para cerca de 5% após 50 prompts, enquanto a taxa de interceptação do modo automático permaneceu constante. Dados de produção reavaliados em uma escala de severidade de 0 a 10 mostraram que, no nível 7 ou acima, 6,3% das sessões aprovadas manualmente envolveram ações prejudiciais não solicitadas explicitamente pelo usuário, em comparação com 2,4% no modo automático. O classificador foi testado de forma adversarial com a Apollo Research, que injetou ataques sintéticos em traços reais de codificação; após o endurecimento, o modo automático recuperou cerca de metade dos ataques anteriormente perdidos, com a taxa de falhas caindo de 12% para 7% nos conjuntos de dados combinados. Em testes de injeção de prompt realizados pela Trajectory Labs, o Claude Fable 5, o Opus 5 e o Sonnet 5 executando o modo automático não foram comprometidos em 720 tentativas, enquanto o GPT-5.6 Sol no modo Auto-review do Codex teve uma taxa de sucesso de 5,83% e de 19,03% no modo Full Access. Três casos públicos de interceptação incluem o bloqueio de um plano para publicar um relatório em um site público de compartilhamento de código, o bloqueio de uma terminação em massa de processos em 2000 pods e a sinalização de um papel na nuvem com permissões totais de administrador. Novos recursos incluem a negação dura de exfiltração de dados, a diferenciação entre acesso a chaves e informações sensíveis, a verificação do status do git antes de comandos como git reset --hard e a sondagem do lado da API para tentativas de injeção. Os usuários podem alternar os modos com Shift+Tab na CLI ou no menu suspenso de modos no desktop; os administradores podem definir padrões para toda a organização ou desabilitar completamente o modo automático. A Anthropic observa que o modo automático reduz, mas não elimina o risco, e recomenda revisar mudanças de alto risco.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas