⚡ 突发新闻
Anthropic 发布 Claude Opus 5:以相同 Opus 价格提供代理编程和计算机任务能力
Anthropic
Anthropic 发布了 Claude Opus 5,这是一款新的旗舰模型,具备更强的代理能力,定价不变(每百万 token 输入 5 美元,输出 25 美元),上下文窗口为 100 万 token。该模型在编程、网络安全和自主任务基准测试中取得了显著进步,并采用了更新的思考机制和修订后的安全策略。
Anthropic 已发布 Claude Opus 5,取代 Opus 4.8 成为旗舰级 Opus 模型。价格保持不变:每百万输入 token 5 美元,每百万输出 token 25 美元。该模型在智能水平上接近 Claude Fable 5,而价格仅为后者的一半,现已成为 Claude Max 的默认模型,也是 Claude Pro 中最强大的模型。在 API 层面,发生了三项关键变化:思考功能默认启用(effort 参数控制深度);禁用思考(设置 type: disabled)并使用 effort xhigh 或 max 现在会返回 400 错误;建议开发者移除类似“启用最终检查”的提示,因为模型已具备自我检查能力。模型 ID 为 claude-opus-5,上下文窗口为 1M token(最大值和默认值),最大输出通过同步 Messages API 为 128k token,通过 Message Batches API 最高可达 300k token。在基准测试中,该模型表现出显著增长:FrontierBench v0.1 上为 43.3%(Opus 4.8 为 18.7%),SWE-bench Verified 上为 96.0%,OSWorld 2.0 上为 70.57%,Zapier AutomationBench 上为 26.0%。代理任务结果最为强劲:该模型解决了 IMO 2026 全部 42 道题目(获得金牌)。在高努力模式下,ARC-AGI-3 得分为 30.16%(比此前纪录高出 4 倍)。在多模态任务中,工具(如容器、图像裁剪)远比“思考”更有效:在 Chartography 上,使用工具时的得分为 83.0%,而仅靠思考为 29.6%。在网络安全方面,能力作为副作用有所提升:在 ExploitBench 上,该模型获得了 10.14 个标志和 99 个完整漏洞利用(Mythos 5 为 132 个)。Anthropic 仅放宽了源代码漏洞搜寻的限制;二进制扫描、渗透测试和漏洞利用生成仍被禁止。分类器触发频率将比 Fable 5 低约 85%。在英国 AISI 测试中,该模型在 10 次尝试中解决了 8 次“最后之人”任务。根据 RSP 计划,该模型具备 CB-1 能力,但不具备 CB-2。在提示注入防御方面表现出色:浏览器攻击在无保护情况下从 31.5% 降至 3.70%,启用自动模式后降至 0%。然而,该公司也公布了不足之处,包括与 Opus 4.8 相比,事实性幻觉的发生率略高。
来源: MarkTechPost —
原文
