Claude Opus 5 : le modèle le plus intelligent selon Artificial Analysis – Ce qui se cache derrière les scores
Anthropic
OpenAI
Anthropic a publié Claude Opus 5 le 24 juillet 2026, affirmant qu'il approche l'intelligence de leur modèle haut de gamme Claude Fable 5 pour la moitié du prix. L'indice de référence indépendant d'Artificial Analysis place Opus 5 en première position (61 points), un point devant Fable 5 et deux devant GPT-5.6 Sol. Cependant, le modèle est jugé lent et verbeux, avec un risque de surenchère de réflexion dans les réglages d'effort maximal.
Anthropic a dévoilé Claude Opus 5 le 24 juillet 2026, positionné entre Sonnet 5 et les modèles restreints Fable/Mythos 5. Il propose une fenêtre de contexte de 1 million de tokens, une sortie de 128 000 tokens, et un raisonnement activé par défaut avec cinq niveaux d'effort : faible, moyen, élevé, extra, max. Sur les benchmarks internes, Opus 5 obtient 43,3 % sur Frontier-Bench v0.1 (codage agentique) contre 18,7 % pour Opus 4.8 et 33,7 % pour Fable 5 ; sur ARC-AGI-3 (raisonnement abstrait), il atteint 30,2 %, comparé à 7,8 % pour GPT-5.6 Sol. Cependant, l'indice indépendant Artificial Analysis Intelligence donne à Opus 5 un score de 61 (effort max), soit un point de plus que Fable 5 (60) et deux de plus que GPT-5.6 Sol (59), le déclarant modèle le plus intelligent d'une courte tête. Le modèle est décrit comme nettement lent et verbeux : le temps jusqu'au premier token à effort max dépasse une minute, et la consommation totale de tokens pour la suite de benchmarks était d'environ 100 millions contre une médiane d'environ 63 millions. Malgré ses victoires, Opus 5 perd sur le codage agentique DeepSWE v1.1 (68,8 % contre 72,7 % pour GPT-5.6 Sol), HealthBench Professional (59,8 % contre 66,0 % pour Mythos 5) et Legal Agent Benchmark (11,7 % contre 13,3 % pour Fable 5). Le rapport d'Anthropic met en avant un cas où Opus 5, recevant un plan sans vision, a écrit son propre programme de vision par ordinateur à partir de données brutes de pixels pour résoudre la tâche, tandis que les concurrents ont échoué. Du côté négatif, dans un test de conception de protéines avec un budget de 10 000 dollars et 24 heures, Opus 5 n'a rien livré lors d'une exécution et seulement 17 variants non classés lors d'une autre, victime de boucles d'auto-vérification improductives. L'entreprise prévient que l'effort max peut souffrir de réflexion excessive et recommande de commencer par extra pour le codage et élevé pour les autres tâches.
Source: Habr — хаб ИИ —
original
