Claude Fable 5 在从零编写代码重写任务上超越 GPT-5.6:原因解析
Epoch AI 的 MirrorCode 基准测试显示,Claude Fable 5 解决了 64% 的任务,而 GPT-5.6 Sol 仅解决了 20%。这一差距源于可靠性,而非原始能力:Sol 常常部分解决问题,而 Fable 则能始终如一地完成。Fable 在训练数据稀少的 Ada 语言上表现强劲,表明其依靠的是技能而非记忆。
Anthropic
OpenAI
Habr — хаб ИИ03.08 · 23:02

