NVIDIA NeMo AutoModel يُسرّع الضبط الدقيق لـ Mixture of Experts بنسبة 3.7x باستخدام Expert Parallelism و DeepEP
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
قدمت NVIDIA مكتبة NeMo AutoModel مفتوحة المصدر، المبنية على Hugging Face Transformers الإصدار 5، والتي تحقق سرعة تدريب أعلى بنسبة 3.4-3.7x وتستخدم ذاكرة GPU أقل بنسبة 29-32% لنماذج MoE عبر Expert Parallelism و DeepEP المدمجة لعمليات الإرسال الشامل ونوى TransformerEngine - كل ذلك باستخدام واجهة from_pretrained() نفسها مع تغيير بسيط في الاستيراد.
NVIDIA NeMo AutoModel هي مكتبة مفتوحة المصدر ضمن إطار عمل NVIDIA NeMo لبناء نماذج الذكاء الاصطناعي التوليدية المخصصة على نطاق واسع. تعتمد هذه المكتبة على Transformers v5، مع إضافة التوازي بين الخبراء (EP)، والإرسال المندمج من الكل إلى الكل عبر DeepEP، ونوى TransformerEngine، مما يحقق إنتاجية تدريب أعلى بنسبة 3.4 إلى 3.7 مرة واستهلاكًا أقل لذاكرة معالج الرسوميات (GPU) بنسبة 29-32% عند ضبط نماذج خليط الخبراء (MoE) مقارنةً بـ Transformers v5 الأصلية، وذلك باستخدام واجهة برمجة التطبيقات from_pretrained() نفسها مع تغيير سطر استيراد واحد. تقوم الفئة NeMoAutoModelForCausalLM بتوريث الفئة AutoModelForCausalLM، مما يتيح التوافق مع واجهة برمجة تطبيقات Hugging Face Transformers. تعود مكاسب الأداء إلى تقليل ضغط الذاكرة من خلال توزيع أوزان الخبراء عبر وحدات معالجة الرسوميات (GPUs) بفضل التوازي بين الخبراء، ودمج الاتصال مع الحساب عبر DeepEP، وتسريع العمليات الأساسية عبر نوى TransformerEngine. تشمل المعايير الضبط الكامل لنموذج NVIDIA Nemotron 3 Ultra 550B A55B عبر 16 عقدة (128 معالج رسوميات) مع EP=64 لتحقيق 815 رمزًا في الثانية لكل معالج رسوميات (TPS/GPU) وذاكرة قصوى تبلغ 58.2 جيبيبايت (GiB)، بينما نفذت ذاكرة Transformers v5. أظهرت معايير العقدة الواحدة على 8 معالجات H100 سعة 80 جيبيبايت لنموذج Qwen3-30B-A3B تسارعًا بمقدار 3.69 مرة (11,340 مقابل 3,075 TPS/GPU) وانخفاضًا في الذاكرة بنسبة 29% (48.1 مقابل 68.2 جيبيبايت)، ولنموذج Nemotron 3 Nano 30B A3B تسارعًا بمقدار 3.36 مرة (15,421 مقابل 4,583 TPS/GPU) وانخفاضًا في الذاكرة بنسبة 32% (42.5 مقابل 62.1 جيبيبايت). توفر NeMo AutoModel تطبيقات مضبوطة يدويًا لبنى MoE الشائعة مثل Qwen3 و NVIDIA Nemotron و GPT-OSS و DeepSeek V3، مع العودة إلى تطبيق Hugging Face الأصلي (vanilla HF) للبنى الأخرى. تستخدم بوابة توجيه متوازنة للمعايير لمحاكاة نقطة التشغيل المثلى. يتم تكوين التوازي بين الخبراء عبر شبكة موزعة، مما يسمح بتجميع التوازي بين الخبراء وتوازي البيانات على نفس الأجهزة (مثل ep=8, dp=8).
المصدر: Hugging Face blog —
الأصلي
