Claude Opus 5:据Artificial Analysis称最智能模型——高分背后的真相
Anthropic
OpenAI
Anthropic于2026年7月24日发布Claude Opus 5,声称其智能水平接近顶级模型Claude Fable 5,但价格仅为其一半。独立基准指数Artificial Analysis将Opus 5评为第一(61分),领先Fable 5一分、GPT-5.6 Sol两分。但该模型被指出速度慢且冗长,在最大努力设置下有过度思考的风险。
Anthropic于2026年7月24日发布了Claude Opus 5,定位介于Sonnet 5与受限制的Fable/Mythos 5之间。该模型拥有100万个令牌的上下文窗口、12.8万个令牌的输出,并默认启用推理功能,提供五个努力等级:低、中、高、额外、最大。在内部基准测试中,Opus 5在Frontier-Bench v0.1(智能体编程)上得分为43.3%,而Opus 4.8为18.7%,Fable 5为33.7%;在ARC-AGI-3(抽象推理)上得分为30.2%,相比之下GPT-5.6 Sol为7.8%。然而,独立的人工分析智能指数(Artificial Analysis Intelligence Index)在最大努力下给Opus 5打分为61分,仅比Fable 5(60分)高1分,比GPT-5.6 Sol(59分)高2分,宣称这是最智能的模型,但优势微弱。该模型被描述为明显缓慢且冗长:在最大努力下,首个令牌的生成时间超过一分钟,基准测试套件的总令牌消耗约为1亿个,而中位数约为6300万个。尽管有这些优势,Opus 5在DeepSWE v1.1智能体编程(68.8%对GPT-5.6 Sol的72.7%)、HealthBench Professional(59.8%对Mythos 5的66.0%)和Legal Agent Benchmark(11.7%对Fable 5的13.3%)上落后。Anthropic的报告中强调了一个案例:给定一个没有视觉信息的蓝图,Opus 5自行从原始像素数据编写计算机视觉程序来解决问题,而竞争对手则失败。在消极方面,在一项蛋白质设计测试中,预算为1万美元、时限为24小时,Opus 5一次运行未产出任何结果,另一次仅产出17个未排序的变体,陷入了低效的自我验证循环。该公司警告称,最大努力可能因过度思考而受影响,并建议从额外努力开始用于编程,高努力用于其他任务。
来源: Habr — хаб ИИ —
原文
