शोध 🇺🇸 27.07.2026 07:02

ABBEL: लंबे समय तक कुशल संवाद के लिए LLM को विश्वास अपडेट करने का प्रशिक्षण

CursorCursor Alibaba/QwenAlibaba/Qwen
ABBEL एक ऐसा ढांचा है जो दीर्घकालिक कार्यों में LLM के प्रदर्शन को बेहतर बनाता है, जिसमें प्राकृतिक भाषा विश्वास अवस्थाओं का उपयोग करके सारांशों की सूचना सामग्री को अलग और पर्यवेक्षण किया जाता है। यह पूर्ण-संदर्भ मॉडलों की तुलना में प्रदर्शन अंतर को लगभग 50% तक कम करता है, जबकि प्रशिक्षण चरणों को आधा कर देता है और काफी कम मेमोरी का उपयोग करता है।
ABBEL (ऑटोएनकोडर बिलीफ बॉटलनेक फॉर एफिशिएंट लर्निंग) उस समस्या का समाधान करता है जहां लार्ज लैंग्वेज मॉडल (LLM) लंबे इंटरैक्शन में संघर्ष करते हैं क्योंकि संपूर्ण संदर्भ इतिहास संदर्भ विंडो में फिट नहीं हो पाता। पारंपरिक पुनरावर्ती सारांशीकरण के बजाय, ABBEL सारांश को विश्वास अवस्था के रूप में तैयार करता है जिसे मॉडल समय-समय पर अपडेट करता है। विश्वास ग्रेडिंग एक सहायक रीइन्फोर्समेंट लर्निंग (RL) कार्य जोड़ता है जो विश्वासों को इस आधार पर पुरस्कृत करता है कि वे हाल के प्रेक्षणों को कितनी अच्छी तरह पुनर्निर्मित कर सकते हैं। कोलैबबेंच सहयोगी कोडिंग वातावरण में, पुनर्निर्माण-आधारित विश्वास ग्रेडिंग के साथ ABBEL ने 0.48 का टेस्ट पास रेट (पूर्ण संदर्भ के लिए 0.52 की तुलना में) और 0.36 की सफलता दर (पूर्ण संदर्भ के लिए 0.39 की तुलना में) प्राप्त की, जबकि 6.01 पीक टोकन का उपयोग किया (पूर्ण संदर्भ के लिए 14.08 की तुलना में) और केवल 50 प्रशिक्षण चरणों की आवश्यकता हुई (100 की तुलना में)। कॉम्बिनेशन लॉक कार्य में, डोमेन-नॉलेज विश्वास ग्रेडिंग ने ABBEL को पूर्ण-संदर्भ प्रदर्शन के करीब या उससे अधिक पहुंचने की अनुमति दी। मल्टी-ऑब्जेक्टिव क्यूए (QA) में, पीक बिलीफ लेंथ पेनल्टी ने न्यूनतम प्रदर्शन हानि के साथ मेमोरी उपयोग को कम किया। पेपर बर्कले एआई के लिदायन एट अल. द्वारा लिखा गया था।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार