Claude Fable 5 在从零编写代码重写任务上超越 GPT-5.6:原因解析
Anthropic
OpenAI
Epoch AI 的 MirrorCode 基准测试显示,Claude Fable 5 解决了 64% 的任务,而 GPT-5.6 Sol 仅解决了 20%。这一差距源于可靠性,而非原始能力:Sol 常常部分解决问题,而 Fable 则能始终如一地完成。Fable 在训练数据稀少的 Ada 语言上表现强劲,表明其依靠的是技能而非记忆。
Epoch AI 更新了其 MirrorCode 排行榜,显示 Anthropic 的 Claude Fable 5 解决了 64% 的任务,而 OpenAI 的 GPT-5.6 Sol 仅解决了 20%。鉴于这些模型在其他测试中表现相当,这一三倍差距看起来异常,但 Epoch AI 和 Anthropic 未提供官方解释。MirrorCode 由 Epoch AI 与 METR 合作开发,要求模型从头重写整个程序,仅能看到一个可执行的“黑盒”、文档和可见测试;解决方案必须通过所有隐藏测试。该基准测试包含 15 个真实程序,如 sed 和 Ruff,每个程序用两种语言实现,每次尝试的预算为 100 亿个 token 和 7 天时间。热图分析显示,Sol 经常部分解决问题(成功率为 50%、33%、17%),而 Fable 几乎总能完成(成功率为 100%、83%)。另一个线索是:Fable 在 Ada 上的性能仅略有下降(61% 对比 Go 上的 64%),而 OpenAI 模型在 Ada 上损失显著——Sol 从 24% 降至 19%,GPT-5.4 从 21% 降至 12%,GPT-5.5 从 17% 降至 5%。由于这些程序在训练数据中几乎没有 Ada 实现,Fable 在 Ada 上的韧性表明其具备真正的技能,而非记忆。然而,Epoch 自身的污染检查发现 25 个程序中有 17 个存在记忆迹象,且该基准测试的精确规格设置与真实世界开发不同。
来源: Habr — хаб ИИ —
原文
