Claude Fable 5がGPT-5.6を上回るスクラッチからのコード書き換え。その理由はここにある
Anthropic
OpenAI
Epoch AIのMirrorCodeベンチマークでは、Claude Fable 5がタスクの64%を解決したのに対し、GPT-5.6 Solは20%でした。この差は、生の能力ではなく信頼性に起因しています。Solはタスクを部分的にしか解決しないことが多いのに対し、Fableは一貫して完了させます。また、Fableは訓練データが少ない言語であるAdaでも優れたパフォーマンスを示しており、記憶ではなくスキルを示唆しています。
Epoch AIがMirrorCodeのリーダーボードを更新し、AnthropicのClaude Fable 5がタスクの64%を解決したのに対し、OpenAIのGPT-5.6 Solはわずか20%しか解決できなかったことが明らかになった。この3倍の差は、他のテストでは両モデルが同等の性能を示していることを考えると異常に見えるが、Epoch AIとAnthropicは公式な説明を行っていない。METRと共同開発されたMirrorCodeは、モデルが実行可能な「ブラックボックス」、ドキュメント、可視テストのみを見て、プログラム全体をゼロから書き直すことを要求し、解決策はすべての隠れたテストに合格しなければならない。このベンチマークにはsedやRuffなどの実在するプログラム15個が含まれ、それぞれが2つの言語で実装されており、試行ごとに100億トークンと7日間の予算が与えられる。ヒートマップの分析によると、Solはタスクを部分的にしか解決しないことが多く(成功率50%、33%、17%)、一方Fableはほぼ常に完了する(100%、83%)。もう一つの手がかり:Fableの性能はAdaではわずかに低下するが(Goで64%に対して61%)、OpenAIのモデルはAdaで大幅に低下する。Solは24%から19%に、GPT-5.4は21%から12%に、GPT-5.5は17%から5%に落ち込む。学習データにこれらのプログラムのAda実装はほとんど存在しないため、FableのAda耐性は記憶ではなく真のスキルを示している。しかし、Epoch自身の汚染チェックでは25プログラム中17プログラムに記憶の兆候が見つかり、ベンチマークの厳密仕様設定は実際の開発とは異なる。
出典: Habr — хаб ИИ —
原文
