NVIDIA NeMo AutoModel: एक्सपर्ट पैरेललिज़्म और DeepEP से MoE फ़ाइन-ट्यूनिंग में 3.7x तेज़ी

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA ने NeMo AutoModel नामक एक ओपन लाइब्रेरी पेश की है, जो Hugging Face Transformers v5 पर आधारित है। यह एक्सपर्ट पैरेललिज़्म, DeepEP फ्यूज़्ड ऑल-टू-ऑल डिस्पैच और TransformerEngine कर्नेल के ज़रिए MoE मॉडलों के लिए 3.4-3.7 गुना अधिक ट्रेनिंग थ्रूपुट और 29-32% कम GPU मेमोरी प्रदान करता है—यह सब from_pretrained() API से, केवल एक इंपोर्ट बदलाव के साथ।
NVIDIA NeMo AutoModel, NVIDIA NeMo फ्रेमवर्क के अंतर्गत एक ओपन लाइब्रेरी है, जो बड़े पैमाने पर कस्टम जनरेटिव AI मॉडल बनाने के लिए डिज़ाइन की गई है। यह Transformers v5 पर आधारित है, और इसमें एक्सपर्ट पैरेललिज़म (EP), DeepEP फ्यूज़्ड ऑल-टू-ऑल डिस्पैच, और ट्रांसफॉर्मर इंजन कर्नेल जोड़े गए हैं, जिससे मूल Transformers v5 की तुलना में MoE मॉडलों के फाइन-ट्यूनिंग में 3.4-3.7 गुना अधिक ट्रेनिंग थ्रूपुट और 29-32% कम GPU मेमोरी प्राप्त होती है, और यह उसी from_pretrained() API के साथ एकल इम्पोर्ट लाइन बदलकर काम करता है। NeMoAutoModelForCausalLM, AutoModelForCausalLM का उपवर्ग है, जो Hugging Face Transformers के साथ API संगतता सुनिश्चित करता है। प्रदर्शन लाभ एक्सपर्ट पैरेललिज़म से आते हैं, जो एक्सपर्ट वेट को GPU में वितरित करके मेमोरी दबाव कम करता है; DeepEP संचार को गणना के साथ जोड़ता है; और TransformerEngine कर्नेल मुख्य संचालन को गति प्रदान करते हैं। बेंचमार्क में 16 नोड्स (128 GPU) पर NVIDIA Nemotron 3 Ultra 550B A55B का पूर्ण फाइन-ट्यूनिंग शामिल है, जिसमें EP=64 के साथ 815 TPS/GPU और 58.2 GiB पीक मेमोरी प्राप्त हुई, जबकि Transformers v5 मेमोरी से बाहर हो गया। 8x H100 80GB पर एकल-नोड बेंचमार्क में Qwen3-30B-A3B के लिए 3.69 गुना स्पीडअप (11,340 बनाम 3,075 TPS/GPU) और 29% मेमोरी कमी (48.1 बनाम 68.2 GiB) मिली, और Nemotron 3 Nano 30B A3B के लिए 3.36 गुना स्पीडअप (15,421 बनाम 4,583 TPS/GPU) और 32% मेमोरी कमी (42.5 बनाम 62.1 GiB) मिली। NeMo AutoModel लोकप्रिय MoE आर्किटेक्चर जैसे Qwen3, NVIDIA Nemotron, GPT-OSS और DeepSeek V3 के लिए हैंड-ट्यून्ड इम्प्लीमेंटेशन प्रदान करता है, और अन्य मॉडलों के लिए वेनिला HF पर वापस आ जाता है। बेंचमार्क में आदर्श ऑपरेटिंग पॉइंट का अनुकरण करने के लिए संतुलित रूटिंग गेट का उपयोग किया जाता है। एक्सपर्ट पैरेललिज़म को डिस्ट्रीब्यूटेड मेश के माध्यम से कॉन्फ़िगर किया जाता है, जिससे EP और डेटा पैरेललिज़म एक ही उपकरणों पर संयुक्त हो सकते हैं (जैसे, ep=8, dp=8)।
स्रोत: Hugging Face blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार