ReasoningBank: AI एजेंटों के लिए सफलताओं और असफलताओं से सीखने हेतु एक मेमोरी फ्रेमवर्क
Google/DeepMind
गूगल के शोधकर्ताओं ने ReasoningBank प्रस्तावित किया है, जो एक नवीन एजेंट मेमोरी फ्रेमवर्क है जो सफल और असफल दोनों अनुभवों से सामान्यीकरण योग्य तर्क रणनीतियों को आसवित (distill) करता है, जिससे तैनाती के बाद निरंतर सीखने में सक्षम बनाता है। वेब ब्राउज़िंग और सॉफ्टवेयर इंजीनियरिंग बेंचमार्क पर मूल्यांकन किया गया, यह एजेंट की प्रभावशीलता और दक्षता में सुधार करता है। यह फ्रेमवर्क अन्वेषण प्रक्षेपवक्र (exploration trajectories) का लाभ उठाने के लिए मेमोरी-अवेयर टेस्ट-टाइम स्केलिंग (MaTTS) का उपयोग करता है।
गूगल क्लाउड के शोध वैज्ञानिक जून यान और चेन-यू ली ने ICLR 2025 में प्रस्तुत एक नए एजेंट मेमोरी फ्रेमवर्क ReasoningBank को पेश किया। यह मौजूदा एजेंटों की उस सीमा को संबोधित करता है जो तैनाती के बाद पिछले अनुभवों से सीखने में विफल रहते हैं। मौजूदा विधियों के विपरीत, जो विस्तृत एक्शन लॉग या केवल सफल वर्कफ़्लो संग्रहीत करती हैं, ReasoningBank सफलताओं और असफलताओं दोनों से उच्च-स्तरीय, स्थानांतरणीय रीज़निंग पैटर्न निकालता है। प्रत्येक मेमोरी आइटम को संरचित रिकॉर्ड के रूप में संग्रहीत किया जाता है जिसमें परिदृश्य, निर्देश, रीज़निंग रणनीति और एक्शन स्केच शामिल होते हैं। सिस्टम पुनर्प्राप्ति, निष्कर्षण और समेकन के एक बंद लूप में काम करता है, जो स्व-मूल्यांकन के लिए LLM-as-a-judge (भाषा मॉडल को न्यायाधीश के रूप में) का उपयोग करता है। ReasoningBank मेमोरी-अवेयर टेस्ट-टाइम स्केलिंग (MaTTS) भी प्रस्तुत करता है जो कंट्रास्टिव और रिफाइनमेंट सिग्नल के माध्यम से उच्च-गुणवत्ता वाली मेमोरी उत्पन्न करने के लिए एक्सप्लोरेशन ट्रैजेक्टरी का उपयोग करता है। Gemini-2.5-Flash का उपयोग करके WebArena और SWE-Bench-Verified पर मूल्यांकन में, ReasoningBank ने कार्य सफलता दर और दक्षता में Vanilla ReAct, Synapse और Agent Workflow Memory सहित बेसलाइन्स को पीछे छोड़ दिया। शोधकर्ताओं ने समय के साथ रणनीतिक परिपक्वता देखी, जहां सरल प्रक्रियात्मक नियम जटिल, निवारक तर्क संरचनाओं में विकसित हुए।
स्रोत: Google Research —
मूल
