MarathonMemBench: आपके LLM एजेंट की मेमोरी के परीक्षण के लिए एक नया बेंचमार्क
Anthropic
MarathonMemBench एक नए प्रकार का बेंचमार्क प्लेटफ़ॉर्म है जो लंबी, प्राकृतिक बातचीत के माध्यम से LLM एजेंटों की दीर्घकालिक मेमोरी का परीक्षण करता है, जिससे विशेष एजेंट संशोधनों की आवश्यकता नहीं होती। इसे इसलिए बनाया गया क्योंकि मौजूदा मेमोरी बेंचमार्क या तो पहले से रिकॉर्ड किए गए संवादों को लोड करने की आवश्यकता होती है (ऑफ-पॉलिसी) या अतिरिक्त एजेंट क्षमताओं की मांग करते हैं जैसे स्टेट स्नैपशॉट या प्रोग्रामेटिक मेमोरी एक्सेस। यह प्लेटफ़ॉर्म एजेंट-अज्ञेयवादी होने के लिए डिज़ाइन किया गया है, जिसके लिए केवल एक चैट इंटरफ़ेस की आवश्यकता होती है, और यह संदर्भ विंडो से अधिक लंबी बातचीत में तथ्यों को याद रखने और बनाए रखने की एजेंट की क्षमता का मूल्यांकन करने की अनुमति देता है।
यह लेख MarathonMemBench का परिचय देता है, जो LLM एजेंटों की दीर्घकालिक स्मृति के मूल्यांकन के लिए एक मंच है। लेखक का तर्क है कि ट्रांसफॉर्मर-आधारित मॉडलों की सीमित संदर्भ विंडो एक मौलिक सीमा है, और एजेंटों को इसे दूर करने के लिए बाहरी मेमोरी टूल्स, जैसे फ़ाइलों में लिखना, का उपयोग करना चाहिए। मौजूदा मेमोरी बेंचमार्क की आलोचना की जाती है क्योंकि उन्हें एजेंटों को विशेष रूप से अनुकूलित करने की आवश्यकता होती है: ऑफ-पॉलिसी बेंचमार्क (जैसे LoCoMo, LongMemEval, MemoryAgentBench, BEAM) पूर्व-रिकॉर्ड किए गए संवाद लोड करते हैं, जबकि ऑन-पॉलिसी बेंचमार्क (जैसे AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) स्टेट स्नैपशॉट, प्रोग्रामेटिक मेमोरी एक्सेस, या अपने स्वयं के वातावरण में काम करने की मांग करते हैं। इसके बजाय, MarathonMemBench एक मंच के रूप में चलता है जहाँ एक LLM व्यक्तित्व घंटों तक एजेंट के साथ बातचीत करता है, तथ्य प्रस्तुत करता है, उन्हें बदलता है, और अंत में स्मरण का परीक्षण करता है। इसके लिए केवल एजेंट के पास चैट इंटरफ़ेस होना आवश्यक है। लेख मौजूदा बेंचमार्क, मंच की वास्तुकला, और ओपन-सोर्स एजेंटों के परिणामों को कवर करने वाले भविष्य के अनुभागों की योजना बनाता है, जो आश्चर्यजनक रूप से मजबूत थे।
स्रोत: Habr — хаб ИИ —
मूल
