⚡ EN DIRECT
Anthropic dévoile Claude Opus 5 : codage agentique et tâches informatiques au même prix que l'Opus
Anthropic
Anthropic a publié Claude Opus 5, un nouveau modèle phare avec des capacités agentiques améliorées, des tarifs inchangés (5/25 dollars par million de tokens) et une fenêtre de contexte d'un million de tokens. Le modèle affiche des gains significatifs en matière de codage, de cybersécurité et de benchmarks de tâches autonomes, avec un mécanisme de réflexion mis à jour et des politiques de sécurité révisées.
Anthropic a publié Claude Opus 5, qui remplace Opus 4.8 comme modèle phare de niveau Opus. Les prix restent les mêmes : 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie. Le modèle se rapproche de Claude Fable 5 en intelligence à moitié prix et est désormais le modèle par défaut sur Claude Max et le plus puissant sur Claude Pro. Au niveau de l'API, trois changements clés ont eu lieu : la réflexion est activée par défaut (le paramètre d'effort contrôle la profondeur) ; la désactivation de la réflexion (type : désactivé) avec un effort élevé ou maximal renvoie désormais une erreur 400 ; les développeurs sont invités à supprimer des invites telles que « activer la vérification finale », car le modèle se vérifie déjà lui-même. L'identifiant du modèle est claude-opus-5, la fenêtre contextuelle est de 1 million de jetons (maximum et par défaut), la sortie maximale est de 128 000 jetons via l'API Messages synchrone et jusqu'à 300 000 via l'API Message Batches. Dans les benchmarks, le modèle a montré une croissance significative : sur FrontierBench v0.1 — 43,3 % (Opus 4.8 — 18,7 %), sur SWE-bench Verified — 96,0 %, OSWorld 2.0 — 70,57 %, Zapier AutomationBench — 26,0 %. Les résultats agentiques sont les plus forts : le modèle a résolu 42 problèmes sur 42 de l'IMO 2026 (médaille d'or). Sur ARC-AGI-3 avec un effort élevé — 30,16 % (4 fois mieux que le record précédent). Dans les tâches multimodales, les outils (conteneurs, recadrage d'images) sont nettement plus efficaces que la « réflexion » : sur Chartography avec outils — 83,0 % contre 29,6 %. En cybersécurité, les capacités ont augmenté comme effet secondaire : sur ExploitBench, le modèle a obtenu 10,14 drapeaux et 99 exploits complets (Mythos 5 — 132). Anthropic a seulement assoupli les restrictions sur la recherche de vulnérabilités dans le code source ; l'analyse binaire, les tests d'intrusion et la génération d'exploits restent bloqués. Les classificateurs se déclencheront environ 85 % moins souvent que sur Fable 5. Sur les tests UK AISI, le modèle a résolu la tâche « The Last Ones » dans 8 tentatives sur 10. Selon le programme RSP, le modèle a des capacités CB-1, mais pas CB-2. Résultat exceptionnel en résistance aux injections de prompts : les attaques par navigateur sont passées de 31,5 % à 3,70 % sans protection et à 0 % avec le mode automatique. Cependant, l'entreprise publie également des inconvénients, notamment un taux légèrement plus élevé d'hallucinations factuelles par rapport à Opus 4.8.
Source: MarkTechPost —
original
