Un pas d'agent — 120 000 jetons : où ils vont et comment nous l'avons corrigé
Un agent autonome peut consommer bien plus de jetons que prévu en raison de l'envoi répété du contexte complet à chaque étape de la boucle d'agent. L'article décrit comment Uma Computer a découvert que la cause réelle n'était pas l'historique de dialogue, mais la surcharge multipliée des instructions système, des schémas d'outils et de la mémoire, et présente trois optimisations : déplacer le volume vers des outils à la demande, passer à un budget de caractères avec des marqueurs de troncature explicites, et définir des attentes de vitesse transparentes.
Les développeurs d'Uma Computer, un agent autonome qui exécute des tâches comme la recherche web, la génération de médias et le montage vidéo, ont enquêté sur la raison pour laquelle une demande d'utilisateur a coûté 38 crédits au lieu du tiers attendu. La facturation montrait 119 208 jetons de prompt et seulement 1 018 jetons de complétion, ce qui signifie que le modèle lisait surtout, n'écrivait pas. L'hypothèse initiale était un historique de dialogue long, mais le dialogue problématique réel ne comportait que deux messages totalisant 530 caractères. La mesure a révélé que le contexte par étape était de 13 900 jetons, et avec 9 étapes, le total atteignait environ 120 000 jetons ; les frais généraux se multipliaient par le nombre d'étapes dans la boucle de l'agent. De plus, le fournisseur réserve le coût du pire cas avec max_tokens défini élevé, ce qui entraîne des erreurs HTTP 402 même avec un solde suffisant. Le correctif consistait à déplacer le contexte préchargé vers des outils à la demande, à utiliser un budget de caractères avec des priorités et des marqueurs de troncature explicites, et à rendre les attentes de rapidité transparentes. L'article souligne que le contexte ne doit jamais être silencieusement caché au modèle et que les optimisations doivent être vérifiées sur des cas concrets, car ils ont failli optimiser pour un cas où l'historique était sans importance.
Source: Habr — хаб ML —
original
