एजेंटशोध 🇷🇺 05.08.2026 14:02

MarathonMemBench: आपके LLM एजेंट की मेमोरी के परीक्षण के लिए एक नया बेंचमार्क

AnthropicAnthropic
MarathonMemBench एक नए प्रकार का बेंचमार्क प्लेटफ़ॉर्म है जो लंबी, प्राकृतिक बातचीत के माध्यम से LLM एजेंटों की दीर्घकालिक मेमोरी का परीक्षण करता है, जिससे विशेष एजेंट संशोधनों की आवश्यकता नहीं होती। इसे इसलिए बनाया गया क्योंकि मौजूदा मेमोरी बेंचमार्क या तो पहले से रिकॉर्ड किए गए संवादों को लोड करने की आवश्यकता होती है (ऑफ-पॉलिसी) या अतिरिक्त एजेंट क्षमताओं की मांग करते हैं जैसे स्टेट स्नैपशॉट या प्रोग्रामेटिक मेमोरी एक्सेस। यह प्लेटफ़ॉर्म एजेंट-अज्ञेयवादी होने के लिए डिज़ाइन किया गया है, जिसके लिए केवल एक चैट इंटरफ़ेस की आवश्यकता होती है, और यह संदर्भ विंडो से अधिक लंबी बातचीत में तथ्यों को याद रखने और बनाए रखने की एजेंट की क्षमता का मूल्यांकन करने की अनुमति देता है।
यह लेख MarathonMemBench का परिचय देता है, जो LLM एजेंटों की दीर्घकालिक स्मृति के मूल्यांकन के लिए एक मंच है। लेखक का तर्क है कि ट्रांसफॉर्मर-आधारित मॉडलों की सीमित संदर्भ विंडो एक मौलिक सीमा है, और एजेंटों को इसे दूर करने के लिए बाहरी मेमोरी टूल्स, जैसे फ़ाइलों में लिखना, का उपयोग करना चाहिए। मौजूदा मेमोरी बेंचमार्क की आलोचना की जाती है क्योंकि उन्हें एजेंटों को विशेष रूप से अनुकूलित करने की आवश्यकता होती है: ऑफ-पॉलिसी बेंचमार्क (जैसे LoCoMo, LongMemEval, MemoryAgentBench, BEAM) पूर्व-रिकॉर्ड किए गए संवाद लोड करते हैं, जबकि ऑन-पॉलिसी बेंचमार्क (जैसे AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) स्टेट स्नैपशॉट, प्रोग्रामेटिक मेमोरी एक्सेस, या अपने स्वयं के वातावरण में काम करने की मांग करते हैं। इसके बजाय, MarathonMemBench एक मंच के रूप में चलता है जहाँ एक LLM व्यक्तित्व घंटों तक एजेंट के साथ बातचीत करता है, तथ्य प्रस्तुत करता है, उन्हें बदलता है, और अंत में स्मरण का परीक्षण करता है। इसके लिए केवल एजेंट के पास चैट इंटरफ़ेस होना आवश्यक है। लेख मौजूदा बेंचमार्क, मंच की वास्तुकला, और ओपन-सोर्स एजेंटों के परिणामों को कवर करने वाले भविष्य के अनुभागों की योजना बनाता है, जो आश्चर्यजनक रूप से मजबूत थे।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार