تسريع الضبط الدقيق لمحولات Transformer باستخدام NVIDIA NeMo AutoModel
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
أطلقت NVIDIA مكتبة NeMo AutoModel مفتوحة المصدر لإنشاء نماذج الذكاء الاصطناعي التوليدية المخصصة على نطاق واسع استنادًا إلى المحولات الإصدار الخامس. تضيف المكتبة توازي الخبراء Expert Parallelism وDeepEP ونواة TransformerEngine، مما يحقق تسريعًا في التدريب بنسبة 3.4–3.7x ويقلل استهاك ذاكرة وحدة معالجة الرسوميات بنسبة 29–32% عند الضبط الدقيق لنماذج MoE دون تغيير واجهة برمجة التطبيقات.
NVIDIA NeMo AutoModel هي مكتبة مفتوحة المصدر ضمن إطار عمل NVIDIA NeMo لبناء نماذج الذكاء الاصطناعي التوليدية المخصصة على نطاق واسع. وهي مبنية على Transformers v5، وتضيف التوازي الخبير (Expert Parallelism)، وإرسال DeepEP المدمج من الكل إلى الكل (all-to-all dispatch)، ونوى محرك المحولات (TransformerEngine)، كما تستخدم التحميل الديناميكي للأوزان v5 لتطبيق هذه التحسينات على مجموعة واسعة من عائلات النماذج. النتيجة هي زيادة في إنتاجية التدريب بمقدار 3.4-3.7 مرة وانخفاض في استخدام ذاكرة وحدة معالجة الرسومات (GPU) بنسبة 29-32% عند الضبط الدقيق لنماذج MoE مقارنة بـ Transformers v5 الأصلي باستخدام نفس واجهة برمجة التطبيقات from_pretrained() - فقط قم بتغيير سطر استيراد واحد دون تعديل باقي الكود. NeMoAutoModelForCausalLM هي فئة فرعية من AutoModelForCausalLM، لذا فإن أي كود يعمل مع نماذج شركة Hugging Face (HF) يعمل أيضًا مع AutoModel. بالنسبة لبنى MoE الشائعة (Qwen3 وNVIDIA Nemotron وGPT-OSS وDeepSeek V3)، تستخدم NeMo AutoModel تطبيقات مخصصة مع انتباه محرك المحولات (TransformerEngine Attention)، وطبقات خطية مطوية (Fused Linear Layers)، ونوى خبراء مخصصة (Custom Expert Kernels). أما بالنسبة للنماذج الأخرى، فيتم استخدام وضع احتياطي مُحسَّن مع نوى Liger. أظهرت قياسات الأداء: عند الضبط الدقيق الكامل لنموذج Nemotron 3 Ultra 550B A55B على 16 عقدة (128 GPU)، حققت NeMo AutoModel 815 رمزًا/ثانية لكل GPU و293 TFLOP/s لكل GPU مع ذروة استخدام للذاكرة بلغت 58.2 جيجابايت، بينما فشل Transformers v5 في التشغيل على هذا المقياس بسبب نقص الذاكرة. في اختبارات العقدة الواحدة مع 8 GPU لـ Qwen3-30B-A3B، أظهرت NeMo AutoModel 11,340 رمزًا/ثانية لكل GPU (مقابل 3,075 لـ v5، بتسارع 3.69x) وذروة استخدام للذاكرة بلغت 48.1 جيجابايت (أقل بنسبة 29% من 68.2 جيجابايت لـ v5). بالنسبة لـ Nemotron 3 Nano 30B A3B، كانت النتائج: 15,421 رمزًا/ثانية (مقابل 4,583، بتسارع 3.36x) وذاكرة 42.5 جيجابايت (أقل بنسبة 32% من 62.1 جيجابايت لـ v5). يتحقق التسارع بفضل ثلاثة عوامل: التوازي الخبير يقلل الضغط على الذاكرة، وDeepEP يدمج الاتصال مع الحساب، ونوى محرك المحولات تسرع العمليات الأساسية.
المصدر: Hugging Face blog —
الأصلي
