Agents 🇷🇺 30.07.2026 17:01

Pourquoi un agent d'IA est en réalité moins cher que le RAG

Bien qu'un assistant RAG classique semble moins cher par requête, les coûts cachés comme les relances des utilisateurs et les escalades vers les opérateurs le rendent globalement plus coûteux. Un agent utilisant une boucle ReAct recherche automatiquement dans plusieurs documents jusqu'à trouver la réponse complète, transformant un processus de 3 tentatives en 27 minutes en une seule réponse de 4 minutes. Des données pilotes réelles issues d'un projet de support confirment que les agents clôturent les questions pour un tiers du coût d'un assistant RAG.
L'article soutient que la comparaison naïve des coûts entre un assistant RAG et un agent est trompeuse. Un assistant RAG classique effectue un seul appel au LLM et s'en remet à l'utilisateur pour affiner la requête si la réponse est erronée. En pratique, les utilisateurs abandonnent souvent après 2 à 3 tentatives, et le cas est alors transféré à un opérateur humain qui passe 10 à 15 minutes à le résoudre. Cela revient à bien plus qu'un simple appel au LLM. Un agent basé sur la boucle ReAct itère de manière autonome sur des outils de recherche, émet des hypothèses, récupère des chunks et synthétise une réponse finale sans intervention de l'utilisateur. L'agent ISTOK de l'auteur utilise cinq outils : VectorSearch (hybride dense + BM25 via Milvus), Search (PostgreSQL en texte intégral), OpenChunk pour lire des chunks de documents entiers, GetDocumentChunks pour la table des matières, et CallOperator en dernier recours après 2 à 3 tentatives propres. Pour gérer les limites de fenêtre de contexte, l'agent a d'abord essayé la synthèse par le LLM, mais l'a trouvée coûteuse et peu fiable ; il utilise désormais une fenêtre glissante (conserver les 6 derniers messages, supprimer les messages d'outils les plus anciens) avec synthèse en repli (maximum 2 par session). Les appels au LLM sont également différenciés : embeddings et reranking bon marché, génération légère pour les étapes simples, moyenne pour le raisonnement typique, et lourde uniquement pour la synthèse finale ou le résumé. Dans un pilote réel avec environ 1200 documents et 1800 requêtes mensuelles, l'assistant a nécessité en moyenne 1 appel au LLM, 2,3 suivis utilisateur, un taux d'escalade de 34 %, 27 minutes pour clôturer, et environ 18 000 tokens par question clôturée. L'agent a nécessité en moyenne 6,4 appels au LLM, 0,3 suivis, 11 % d'escalade, 4 minutes pour clôturer, et environ 15 500 tokens. En termes de coût direct, une question clôturée par l'assistant coûtait environ 52 RUB (coût opérateur inclus), tandis que l'agent coûtait environ 17 RUB, soit une réduction par trois. L'avantage de l'agent disparaît pour les questions factuelles simples ou lorsque la base de connaissances est vide, car il gaspille des itérations. L'agent enregistre l'utilisation de tokens et l'historique des outils pour chaque appel, avec un traçage via Arize Phoenix pour une analyse détaillée des itérations.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches