AI安全智能体 🇨🇳 10.08.2026 09:01

克劳德代码五天后默认切换到自动模式,Anthropic 承担额外成本

AnthropicAnthropic OpenAIOpenAI
Anthropic 将在五天后将克劳德代码的自动模式设为默认,理由是手动权限批准的拒绝率较低,且分类器的安全性能更优。自动模式下每次工具调用的额外令牌成本将不由用户承担。亚马逊、谷歌和微软等云平台有一个月的时间切换至默认自动模式。
Anthropic 将在五天后默认在所有 Claude Code 安装中启用自动模式,此前发现只有 3% 的权限请求被用户拒绝。自动模式分类器每次工具调用会消耗少量额外令牌,但 Anthropic 不会将这一成本转嫁给用户。目前将自动模式作为选项提供的云平台,如亚马逊、谷歌和微软,必须在一个月内切换到默认自动模式。据“Claude Code 之父”透露,Anthropic 内部团队已经 exclusively 使用自动模式。Anthropic 用数据证明这一变更的合理性:手动审批已变得习惯性,权限提示的接受率达 97%,而单项权限请求的拒绝率仅为 3%。在一项包含 1053 名付费测试者的对照实验中,人类参与者拦截了 13.6% 的明显危险命令,而自动模式拦截了 89%;自动模式阻止了人类允许的 800 条命令,而人类只阻止了自动模式允许的 6 条命令。人类的表现随着会话长度下降,从早期的约 17% 降至 50 次提示后的约 5%,而自动模式的拦截率保持不变。按 0 到 10 的严重程度量表重新评分的生产数据显示,在严重程度为 7 及以上时,6.3% 的手动批准会话涉及用户未明确请求的有害操作,而自动模式为 2.4%。该分类器与 Apollo Research 进行了对抗性测试,后者将合成攻击注入真实编码轨迹;经过加固,自动模式恢复了约一半先前遗漏的攻击,在组合数据集上漏报率从 12% 降至 7%。在 Trajectory Labs 的提示注入测试中,运行自动模式的 Claude Fable 5、Opus 5 和 Sonnet 5 在 720 次尝试中未被攻破,而 GPT-5.6 Sol 在 Codex 自动审查模式下的成功率为 5.83%,在完全访问模式下为 19.03%。三个公开拦截案例包括阻止在公共代码共享站点上发布报告的计划、阻止对 2000 个 pod 的批量进程终止,以及标记具有完全管理员权限的云角色。新增功能包括对数据外泄的硬性拒绝、对密钥和敏感信息访问的区分、在 git reset --hard 等命令前检查 git 状态,以及 API 端探测注入尝试。用户可通过 CLI 中的 Shift+Tab 或桌面端的模式下拉菜单切换模式;管理员可设置组织范围的默认值或完全禁用自动模式。Anthropic 指出,自动模式降低了风险但并未消除风险,并建议审查高风险变更。
来源: QbitAI 量子位 — 原文
我们之前关于此话题的帖子 ↓
最新新闻