एक एजेंट कदम — 120,000 टोकन: वे कहाँ जाते हैं और हमने इसे कैसे ठीक किया

एक स्वायत्त एजेंट एजेंट लूप के प्रत्येक चरण पर पूर्ण संदर्भ बार-बार भेजने के कारण अपेक्षा से कहीं अधिक टोकन की खपत कर सकता है। लेख वर्णन करता है कि कैसे उमा कंप्यूटर ने पाया कि असली कारण संवाद इतिहास नहीं, बल्कि सिस्टम निर्देशों, टूल स्कीमा और मेमोरी का गुणा किया हुआ ओवरहेड था, और तीन अनुकूलन प्रस्तुत करता है: मात्रा को ऑन-डिमांड टूल्स में स्थानांतरित करना, स्पष्ट ट्रंकेशन मार्करों के साथ कैरेक्टर बजट पर स्विच करना, और पारदर्शी गति अपेक्षाएँ।
Uma Computer के डेवलपर्स, जो एक स्वायत्त एजेंट है जो वेब खोज, मीडिया निर्माण और वीडियो क्लिपिंग जैसे कार्य करता है, ने जांच की कि एक उपयोगकर्ता अनुरोध पर 38 क्रेडिट क्यों खर्च हुए, जबकि अपेक्षित लागत इसका एक तिहाई थी। बिलिंग से पता चला कि 119,208 प्रॉम्प्ट टोकन और केवल 1,018 कंप्लीशन टोकन थे, जिसका मतलब है कि मॉडल ज्यादातर पढ़ रहा था, लिख नहीं रहा था। प्रारंभिक परिकल्पना लंबे संवाद इतिहास की थी, लेकिन वास्तविक समस्याग्रस्त संवाद में केवल दो संदेश थे जिनकी कुल लंबाई 530 वर्ण थी। माप से पता चला कि प्रति चरण संदर्भ 13,900 टोकन था, और 9 चरणों के साथ कुल लगभग 120,000 टोकन तक पहुंच गया; एजेंट लूप में चरणों की संख्या से ओवरहेड गुणा हो गया। इसके अतिरिक्त, प्रदाता ने अधिकतम टोकन उच्च सेट करके सबसे खराब स्थिति की लागत आरक्षित की, जिससे पर्याप्त शेष राशि होने पर भी HTTP 402 त्रुटियां हुईं। समाधान में प्रीलोडेड संदर्भ को ऑन-डिमांड टूल्स में स्थानांतरित करना, प्राथमिकताओं और स्पष्ट ट्रंकेशन मार्करों के साथ चरित्र बजट का उपयोग करना, और गति की अपेक्षाओं को पारदर्शी बनाना शामिल था। लेख इस बात पर जोर देता है कि संदर्भ को कभी भी मॉडल से चुपचाप नहीं छिपाया जाना चाहिए, और अनुकूलन को ठोस मामलों पर सत्यापित किया जाना चाहिए, क्योंकि उन्होंने लगभग ऐसे मामले के लिए अनुकूलन किया था जहां इतिहास अप्रासंगिक था।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार