ABBEL: लंबे समय तक कुशल संवाद के लिए LLM को विश्वास अपडेट करने का प्रशिक्षण
Cursor
Alibaba/Qwen
ABBEL एक ऐसा ढांचा है जो दीर्घकालिक कार्यों में LLM के प्रदर्शन को बेहतर बनाता है, जिसमें प्राकृतिक भाषा विश्वास अवस्थाओं का उपयोग करके सारांशों की सूचना सामग्री को अलग और पर्यवेक्षण किया जाता है। यह पूर्ण-संदर्भ मॉडलों की तुलना में प्रदर्शन अंतर को लगभग 50% तक कम करता है, जबकि प्रशिक्षण चरणों को आधा कर देता है और काफी कम मेमोरी का उपयोग करता है।
ABBEL (ऑटोएनकोडर बिलीफ बॉटलनेक फॉर एफिशिएंट लर्निंग) उस समस्या का समाधान करता है जहां लार्ज लैंग्वेज मॉडल (LLM) लंबे इंटरैक्शन में संघर्ष करते हैं क्योंकि संपूर्ण संदर्भ इतिहास संदर्भ विंडो में फिट नहीं हो पाता। पारंपरिक पुनरावर्ती सारांशीकरण के बजाय, ABBEL सारांश को विश्वास अवस्था के रूप में तैयार करता है जिसे मॉडल समय-समय पर अपडेट करता है। विश्वास ग्रेडिंग एक सहायक रीइन्फोर्समेंट लर्निंग (RL) कार्य जोड़ता है जो विश्वासों को इस आधार पर पुरस्कृत करता है कि वे हाल के प्रेक्षणों को कितनी अच्छी तरह पुनर्निर्मित कर सकते हैं। कोलैबबेंच सहयोगी कोडिंग वातावरण में, पुनर्निर्माण-आधारित विश्वास ग्रेडिंग के साथ ABBEL ने 0.48 का टेस्ट पास रेट (पूर्ण संदर्भ के लिए 0.52 की तुलना में) और 0.36 की सफलता दर (पूर्ण संदर्भ के लिए 0.39 की तुलना में) प्राप्त की, जबकि 6.01 पीक टोकन का उपयोग किया (पूर्ण संदर्भ के लिए 14.08 की तुलना में) और केवल 50 प्रशिक्षण चरणों की आवश्यकता हुई (100 की तुलना में)। कॉम्बिनेशन लॉक कार्य में, डोमेन-नॉलेज विश्वास ग्रेडिंग ने ABBEL को पूर्ण-संदर्भ प्रदर्शन के करीब या उससे अधिक पहुंचने की अनुमति दी। मल्टी-ऑब्जेक्टिव क्यूए (QA) में, पीक बिलीफ लेंथ पेनल्टी ने न्यूनतम प्रदर्शन हानि के साथ मेमोरी उपयोग को कम किया। पेपर बर्कले एआई के लिदायन एट अल. द्वारा लिखा गया था।
स्रोत: BAIR (Berkeley AI) —
मूल
