एजेंट 🇷🇺 30.07.2026 17:01

AI एजेंट वास्तव में RAG से सस्ता क्यों है

हालांकि एक क्लासिक RAG असिस्टेंट प्रति क्वेरी सस्ता दिखता है, लेकिन उपयोगकर्ता के बाद के सवालों और ऑपरेटर एस्केलेशन जैसी छिपी लागतें इसे कुल मिलाकर अधिक महंगा बनाती हैं। एक एजेंट ReAct लूप का उपयोग करके स्वायत्त रूप से कई दस्तावेज़ों को खोजता है जब तक उसे पूरा उत्तर नहीं मिल जाता, जिससे 3 प्रयासों और 27 मिनट की प्रक्रिया एक ही 4 मिनट के उत्तर में बदल जाती है। एक सपोर्ट प्रोजेक्ट के वास्तविक पायलट डेटा पुष्टि करते हैं कि एजेंट RAG असिस्टेंट की तुलना में एक तिहाई लागत पर सवालों को बंद करते हैं।
लेख का तर्क है कि RAG असिस्टेंट और एजेंट के बीच भोली लागत तुलना भ्रामक है। एक क्लासिकल RAG असिस्टेंट एक LLM कॉल करता है और यदि उत्तर गलत है तो उपयोगकर्ता से क्वेरी को परिष्कृत करने की अपेक्षा करता है। व्यवहार में, उपयोगकर्ता अक्सर 2-3 प्रयासों के बाद हार मान लेते हैं और मानव ऑपरेटर के पास चले जाते हैं, जो मामले को सुलझाने में 10-15 मिनट खर्च करता है। यह एक LLM कॉल से कहीं अधिक बैठता है। ReAct लूप पर आधारित एक एजेंट स्वायत्त रूप से खोज उपकरणों पर पुनरावृत्ति करता है, परिकल्पना करता है, चंक प्राप्त करता है, और उपयोगकर्ता के हस्तक्षेप के बिना अंतिम उत्तर संश्लेषित करता है। लेखक का ISTOK एजेंट पाँच उपकरणों का उपयोग करता है: VectorSearch (Milvus के माध्यम से हाइब्रिड घनत्व+BM25), Search (पोस्टग्रेएसक्यूएल पूर्ण-पाठ), OpenChunk (पूर्ण दस्तावेज़ चंक पढ़ने के लिए), GetDocumentChunks (विषय-सूची के लिए), और CallOperator (अपने स्वयं के 2-3 प्रयासों के बाद अंतिम उपाय के रूप में)। संदर्भ विंडो सीमाओं का प्रबंधन करने के लिए, एजेंट ने पहले LLM सारांशीकरण की कोशिश की लेकिन इसे महंगा और अविश्वसनीय पाया; अब यह एक स्लाइडिंग विंडो (अंतिम 6 संदेश रखें, सबसे पुराने उपकरण संदेश हटाएं) का उपयोग करता है, जिसमें सारांशीकरण अंतिम उपाय के रूप में (प्रति सत्र अधिकतम 2) है। LLM कॉल भी विभेदित हैं: सस्ते एंबेडिंग और रीरैंकिंग, सरल चरणों के लिए हल्की जनरेशन, विशिष्ट तर्क के लिए मध्यम, और केवल अंतिम संश्लेषण या सारांशीकरण के लिए भारी। एक वास्तविक पायलट में जिसमें ~1200 दस्तावेज़ और 1800 मासिक अनुरोध थे, असिस्टेंट ने औसत 1 LLM कॉल, 2.3 उपयोगकर्ता फॉलो-अप, 34% एस्केलेशन दर, 27 मिनट में बंद होने का समय, और ~18,000 टोकन प्रति बंद प्रश्न। एजेंट ने औसत 6.4 LLM कॉल, 0.3 फॉलो-अप, 11% एस्केलेशन, 4 मिनट में बंद होने का समय, और ~15,500 टोकन। प्रत्यक्ष लागत में, असिस्टेंट के बंद प्रश्न की लागत ~52 रूबल (ऑपरेटर लागत सहित) थी, जबकि एजेंट की लागत ~17 रूबल, तीन गुना कमी थी। एजेंट का लाभ सरल तथ्यात्मक प्रश्नों के लिए या जब ज्ञानकोष खाली होता है, गायब हो जाता है क्योंकि यह पुनरावृत्तियाँ बर्बाद करता है। एजेंट प्रत्येक कॉल के टोकन उपयोग और उपकरण इतिहास को लॉग करता है, जिसमें एरीज़ फीनिक्स के माध्यम से ट्रेसिंग होती है ताकि विस्तृत पुनरावृत्ति विश्लेषण हो सके।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार