Qui mène vraiment dans le développement agentique ? Ce n'est pas celui que vous croyez
Anthropic
DeepSeek
OpenAI
Google/DeepMind
Alibaba/Qwen
Une expérience de production de deux semaines menée par un développeur unique utilisant le codage agentique sous une pile de gouvernance a consommé 8,8 milliards de jetons sur 30 993 requêtes. Les coûts révèlent un écart de prix de 72 fois entre les modèles d'Anthropic et DeepSeek, motivé par une technologie de compression de cache KV de 93 %, rendant la gouvernance abordable uniquement avec l'architecture de DeepSeek.
L'article rapporte qu'une expérience de production de deux semaines en juin 2026, où un développeur utilisait des outils de codage agentiques avec une pile de gouvernance, a consommé 8,82 milliards de jetons en 30 993 requêtes, avec 99,38 % de succès de cache. La surcharge de contexte pour la gouvernance (politiques, compétences, invites de révision) varie de 70 000 à 90 000 jetons par appel. Les coûts varient considérablement selon le modèle : le Sonnet 4.6 d'Anthropic coûterait 4 770 $ pour la même charge de travail avec un taux de succès de cache réaliste de 92 %, tandis que le DeepSeek V4 Pro ne coûtait que 66,17 $, soit une différence de 72 fois. Cet écart provient de l'attention latente multi-têtes (MLA) de DeepSeek, qui compresse le cache KV de 93,3 %, permettant des lectures de cache presque gratuites et des caches qui persistent pendant des jours sur des SSD courants via 3FS, tandis qu'Anthropic, OpenAI et Google utilisent GQA/MHA avec des caches qui expirent en moins d'une heure en raison des limites de la mémoire HBM. L'article cite également des incidents chez Uber, Microsoft, Amazon, Pinterest et une entreprise non nommée, montrant des coûts incontrôlés dus à une utilisation non maîtrisée des agents, et soutient que le choix architectural de DeepSeek rend la gouvernance économiquement viable, contrairement aux alternatives plus coûteuses qui obligent les équipes à réduire les mesures de sécurité.
Source: Habr — хаб ИИ —
original
