शोधमॉडल 🇨🇳 28.07.2026 16:03

ग्लोबल-बैच लोड बैलेंस: MoE LLM प्रशिक्षण सुधारने के लिए लगभग मुफ्त लंच

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ने मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स के लिए एक ग्लोबल-बैच लोड बैलेंसिंग विधि प्रस्तावित की है, जो सभी माइक्रो-बैचों में विशेषज्ञ चयन आवृत्तियों को समकालिक करके माइक्रो-बैच स्तर के संतुलन की सीमाओं को पार करती है। प्रयोग विभिन्न मॉडल आकारों और डेटा कॉन्फ़िगरेशनों में बेहतर प्रदर्शन और विशेषज्ञ विशेषज्ञता दिखाते हैं।
Mixture-of-Experts (MoE) आर्किटेक्चर मॉडल पैरामीटर स्केल करने की एक लोकप्रिय तकनीक है, लेकिन Megatron-core जैसे मौजूदा ट्रेनिंग फ्रेमवर्क माइक्रो-बैच स्तर पर लोड बैलेंसिंग लॉस का उपयोग करते हैं, जो तब प्रदर्शन को खराब कर सकता है जब माइक्रो-बैच में सजातीय डेटा (जैसे केवल कोड) होता है। Alibaba Qwen ग्लोबल-बैच बैलेंस लॉस पेश करता है, जो सभी समानांतर ग्रुप्स में एक्सपर्ट चयन आवृत्ति को सिंक्रोनाइज़ करता है और वैश्विक स्तर पर लॉस की गणना करता है। तीन MoE कॉन्फ़िगरेशन (3.4B/0.6B एक्टिवेटेड, 15B/2.54B एक्टिवेटेड, 43B/6.6B एक्टिवेटेड) और 400B टोकन तक के प्रयोगों से पता चलता है कि ग्लोबल-बैच बैलेंस विभिन्न कार्यों पर माइक्रो-बैच बैलेंस से लगातार बेहतर प्रदर्शन करता है। यह एक्सपर्ट्स में महत्वपूर्ण डोमेन विशेषज्ञता भी लाता है, जो माइक्रो-बैच बैलेंस्ड मॉडल में अनुपस्थित होती है। ग्लोबल लॉस के ऊपर एक छोटा माइक्रो-बैच बैलेंस लॉस (वेट 0.01) जोड़ने से प्रभावशीलता को प्रभावित किए बिना ट्रेनिंग स्पीड में सुधार होता है। यह विधि लगभग मुफ्त है क्योंकि सिंक्रोनाइज़ेशन में केवल एक्सपर्ट की संख्या के बराबर आकार का वेक्टर शामिल होता है। यह कार्य arXiv प्रीप्रिंट 2501.11873 में प्रकाशित हुआ है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार