ग्लोबल-बैच लोड बैलेंस: MoE LLM प्रशिक्षण सुधारने के लिए लगभग मुफ्त लंच
Alibaba/Qwen
अलीबाबा क्वेन (Alibaba Qwen) मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts, MoE) मॉडलों के लिए एक ग्लोबल-बैच लोड बैलेंसिंग विधि प्रस्तावित करता है, जो सभी माइक्रो-बैचों में एक्सपर्ट चयन आवृत्तियों को सिंक्रोनाइज़ करके माइक्रो-बैच स्तर संतुलन की सीमाओं को पार करता है। प्रयोग विभिन्न मॉडल आकारों और डेटा कॉन्फ़िगरेशनों में बेहतर प्रदर्शन और एक्सपर्ट विशेषज्ञता दर्शाते हैं।
Mixture-of-Experts (MoE) आर्किटेक्चर मॉडल पैरामीटर स्केल करने की एक लोकप्रिय तकनीक है, लेकिन Megatron-core जैसे मौजूदा ट्रेनिंग फ्रेमवर्क माइक्रो-बैच स्तर पर लोड बैलेंसिंग लॉस का उपयोग करते हैं, जो तब प्रदर्शन को खराब कर सकता है जब माइक्रो-बैच में सजातीय डेटा (जैसे केवल कोड) होता है। Alibaba Qwen ग्लोबल-बैच बैलेंस लॉस पेश करता है, जो सभी समानांतर ग्रुप्स में एक्सपर्ट चयन आवृत्ति को सिंक्रोनाइज़ करता है और वैश्विक स्तर पर लॉस की गणना करता है। तीन MoE कॉन्फ़िगरेशन (3.4B/0.6B एक्टिवेटेड, 15B/2.54B एक्टिवेटेड, 43B/6.6B एक्टिवेटेड) और 400B टोकन तक के प्रयोगों से पता चलता है कि ग्लोबल-बैच बैलेंस विभिन्न कार्यों पर माइक्रो-बैच बैलेंस से लगातार बेहतर प्रदर्शन करता है। यह एक्सपर्ट्स में महत्वपूर्ण डोमेन विशेषज्ञता भी लाता है, जो माइक्रो-बैच बैलेंस्ड मॉडल में अनुपस्थित होती है। ग्लोबल लॉस के ऊपर एक छोटा माइक्रो-बैच बैलेंस लॉस (वेट 0.01) जोड़ने से प्रभावशीलता को प्रभावित किए बिना ट्रेनिंग स्पीड में सुधार होता है। यह विधि लगभग मुफ्त है क्योंकि सिंक्रोनाइज़ेशन में केवल एक्सपर्ट की संख्या के बराबर आकार का वेक्टर शामिल होता है। यह कार्य arXiv प्रीप्रिंट 2501.11873 में प्रकाशित हुआ है।
स्रोत: Alibaba Qwen —
मूल
