Auto 模式成为 Claude Code 在 Pro、Max 和 Team 套餐中的默认选项
Anthropic
Anthropic 宣布,自 8 月 14 日起,Claude Code 的自动模式(Auto 模式)将成为大多数套餐中新会话的默认选项。该公司声称已进行大量安全改进,并依据评估显示,自动模式能够阻止 89% 的人类常常会批准的有害操作。然而,独立验证仍为必要,特别是在针对间接提示注入攻击的情况下。
Anthropic 对 Claude Code 的自动模式充满信心,使其成为 Pro、Max 和 Team 套餐中新会话的默认模式,自 2026 年 8 月 14 日起生效。在 AI 工程师世界博览会的炉边谈话中,Cat Wu 和 Thariq Shihipar 讨论了 Anthropic 如何安全地运行 Claude Code,指出内部几乎所有人都使用自动模式,并且他们已经缓解了诸如提示注入和数据泄露等主要风险。Anthropic 发布了一项由 1053 名付费测试者参与的评估,在测试中一个危险命令被混入会话;只有 13.6% 的人类拒绝执行,而自动模式本可以阻止其中 89% 的动作。Anthropic 还委托 Trajectory Labs 进行了一项评估,该机构针对 Claude Code 和 Codex 测试了 72 种间接提示注入场景,发现对自动模式下的 Claude Fable 5、Opus 5 或 Sonnet 5 的攻击成功率为零。作者 Simon Willison 承认,由于确认疲劳,自动模式可能比人工批准更好,但他担心通过恶意软件包进行的间接提示注入,例如一个测试指令运行恶意工具来窃取数据。他呼吁进行独立确认,并建议在限制数据和工具访问权限的情况下运行代理。
来源: Simon Willison —
原文
