AgentsApplications 🇷🇺 11.08.2026 16:02

Pourquoi les réseaux de neurones consomment des jetons : ce qui se passe dans les longues conversations et comment réduire les coûts

AnthropicAnthropic SYNTX.AISYNTX.AI
Les longues conversations avec l'IA, dotées d'énormes fenêtres de contexte, augmentent les coûts en jetons et peuvent dégrader les performances du modèle. Un utilisateur de Reddit a rapporté avoir dépensé plus d'un milliard de jetons d'entrée avec Claude, tandis qu'un autre a accumulé environ 6 000 dollars sur un agent d'IA laissé sans surveillance. Des études comme « Context Rot » montrent que les performances chutent lorsque le contexte s'allonge, et les experts recommandent de diviser les tâches, de compacter l'historique et d'utiliser la mise en cache des invites pour économiser.
Cet article explique pourquoi les modèles d'IA consomment excessivement de tokens lors de longues conversations et comment réduire les coûts. Il cite des anecdotes de Reddit : un utilisateur a consommé 1,156 milliard de tokens d'entrée avec Claude, un autre a oublié d'arrêter un agent Claude Code qui vérifiait les demandes de tirage toutes les 30 minutes pendant 26 heures, totalisant 46 exécutions et coûtant environ 6 000 dollars. La raison technique des coûts élevés est que chaque nouvelle requête inclut tout le contexte accumulé, qui peut atteindre 800 000 tokens. Anthropic avertit dans sa documentation que les coûts augmentent avec la taille du contexte et recommande de vider l'historique ou d'utiliser la compaction. Des recherches de Chroma (« Context Rot ») et une étude de 2026 (« Diagnosing and Mitigating Context Rot ») montrent que les performances se dégradent avec des entrées plus longues, même avant la limite de la fenêtre de contexte, en particulier avec des informations distrayantes. La mise en cache des invites ne réduit que les coûts pour les préfixes répétitifs, pas les problèmes de contexte inutile. Pour les agents IA, les coûts sont cachés car ils effectuent de nombreuses opérations d'outils de manière autonome. Les conseils pratiques incluent la division des tâches indépendantes, l'utilisation de /clear et /compact dans Claude Code, la fourniture de sections de documents pertinentes uniquement, la mise en cache des instructions stables, et le choix du bon niveau de modèle (Sonnet pour le codage, Opus pour le raisonnement complexe, Haiku pour les tâches simples des sous-agents). L'auteur fait également la promotion de LLM Studio de SYNTX.AI, qui propose plus de 100 modèles d'IA et la possibilité de changer de modèle au sein d'un même dialogue, avec le code promo CTRLAI pour 20 % de réduction. L'article conclut que l'ingénierie des invites doit désormais inclure l'élimination des informations inutiles.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches