Claude Fable 5 surpasse GPT-5.6 dans la réécriture de code from scratch. Voici pourquoi
Anthropic
OpenAI
Le benchmark MirrorCode d'Epoch AI montre Claude Fable 5 résolvant 64% des tâches contre 20% pour GPT-5.6 Sol. L'écart provient de la fiabilité, et non de la capacité brute : Sol résout souvent les tâches partiellement, tandis que Fable les complète systématiquement. La solide performance de Fable en Ada, un langage avec peu de données d'entraînement, suggère une compétence plutôt qu'une mémorisation.
Epoch AI a mis à jour son classement MirrorCode, révélant que Claude Fable 5 d'Anthropic a résolu 64% des tâches, tandis que GPT-5.6 Sol d'OpenAI n'en a réussi que 20%. Cet écart triple semble anormal étant donné que les modèles obtiennent des résultats comparables sur d'autres tests, mais Epoch AI et Anthropic n'ont fourni aucune explication officielle. MirrorCode, développé avec METR, exige que les modèles réécrivent des programmes entiers à partir de zéro, en ne voyant qu'une 'boîte noire' exécutable, de la documentation et des tests visibles ; les solutions doivent réussir tous les tests cachés. Le benchmark comprend 15 programmes réels comme sed et Ruff, chacun implémenté dans deux langages, avec un budget de 10 milliards de jetons et 7 jours par tentative. L'analyse de la carte de chaleur montre que Sol résout souvent partiellement les tâches (taux de réussite de 50%, 33%, 17%), tandis que Fable les termine presque toujours (100%, 83%). Autre indice : les performances de Fable ne diminuent que légèrement sur Ada (61% contre 64% sur Go), tandis que les modèles OpenAI perdent significativement sur Ada — Sol passe de 24% à 19%, GPT-5.4 de 21% à 12%, et GPT-5.5 de 17% à 5%. Étant donné qu'il n'existe presque aucune implémentation Ada de ces programmes dans les données d'entraînement, la résilience de Fable sur Ada indique une compétence réelle plutôt qu'une mémorisation. Cependant, le propre test de contamination d'Epoch a trouvé des signes de mémorisation dans 17 des 25 programmes, et le cadre de spécification exacte du benchmark diffère du développement réel.
Source: Habr — хаб ИИ —
original
