موازنة التحميل على مستوى الدفعة العالمية: تحسين تدريب نماذج MoE LLM دون تكلفة إضافية
Alibaba/Qwen
تقترح Alibaba Qwen طريقة موازنة تحميل على مستوى الدفعة العالمية لنماذج خليط الخبراء (MoE)، تتجاوز قيود الموازنة على مستوى الدفعات الصغيرة من خلال مزامنة ترددات اختيار الخبراء عبر جميع الدفعات الصغيرة. تظهر التجارب تحسنًا في الأداء وتخصص الخبراء عبر أحجام النماذج وتكوينات البيانات المختلفة.
تُعد بنية Mixture-of-Experts (MoE) تقنية شائعة لتوسيع معاملات النماذج، لكن أطر التدريب الحالية مثل Megatron-core تستخدم خسارة موازنة على مستوى الدفعة الصغيرة، مما قد يضر بالأداء عندما تحتوي الدفعات الصغيرة على بيانات متجانسة (مثل الكود فقط). تقدم Alibaba Qwen خسارة موازنة على مستوى الدفعة العالمية، والتي تزامن تواتر اختيار الخبراء عبر جميع المجموعات المتوازية وتحسب الخسارة عالميًا. تُظهر التجارب باستخدام ثلاثة تكوينات MoE (3.4 مليار/0.6 مليار مُفعّل، 15 مليار/2.54 مليار مُفعّل، 43 مليار/6.6 مليار مُفعّل) وما يصل إلى 400 مليار رمز أن موازنة الدفعة العالمية تتفوق باستمرار على موازنة الدفعة الصغيرة في مهام مختلفة. كما تؤدي إلى تخصص ملحوظ في المجالات للخبراء، وهو ما يغيب في النماذج المتوازنة على مستوى الدفعة الصغيرة. إضافة خسارة موازنة صغيرة للدفعة الصغيرة (وزن 0.01) فوق الخسارة العالمية يُحسّن سرعة التدريب دون التأثير على الفعالية. الطريقة شبه مجانية لأن المزامنة تتضمن فقط متجهًا بحجم عدد الخبراء. نُشر العمل في arXiv preprint 2501.11873.
المصدر: Alibaba Qwen —
الأصلي
