الأبحاثالنماذج 🇷🇺 11.08.2026 00:02

توسيع نطاق تدريب نماذج اللغة الكبيرة: من شريحة واحدة إلى مركز بيانات. الفصل الرابع: تدريب محول

يستعرض هذا الفصل أربعة أنواع من التوازي لتدريب المحولات على عدة مسرعات: التوازي في البيانات، والتوازي في البيانات المقسّمة بالكامل (إف إس دي بي)، والتوازي في الموترات، والتوازي في خطوط الأنابيب. ويناقش مزايا وعيوب كل نوع ومتى يتم دمجها، مع التأكيد على أهمية تحقيق أداء محسوب بالكامل لضمان قابلية التوسع.
تشرح المقالة كيفية تدريب المحولات بكفاءة وعلى نطاق واسع. تقدم المقالة رموزًا لأبعاد النموذج (D, F, B, T, L) والأجهزة (C, W, X, Y, Z). يتم وصف أنواع التوازي الأربعة: التوازي في البيانات يقسم الدفعة عبر المسرعات، ويتطلب AllReduce لتجميع التدرجات، وهو فعال عندما يتسع النموذج في مسرع واحد. يعمل FSDP (ZeRO) على تجزئة أوزان النموذج والتدرجات وحالات المحسن، باستخدام AllGather وReduceScatter، وهو محدود بالحوسبة مع أحجام دفعات صغيرة. يقوم التوازي في الموتر بتجزئة مصفوفات الأوزان، وتبادل التنشيطات، ومن الأفضل دمجه مع FSDP لتقليل حجم التنشيط بالنسبة للأوزان. يقسم التوازي في خط الأنابيب النموذج عبر الطبقات، مما يقلل من نقل البيانات ولكنه يقدم 'فقاعات خط الأنابيب'، والتي يمكن تخفيفها عن طريق الدفعات الصغيرة أو تداخل العمليات الحسابية. تشير المقالة إلى أن مزيج FSDP+TP يكون دائمًا تقريبًا محدودًا بالحوسبة، وأن خط الأنابيب شائع في مجموعات وحدات معالجة الرسوميات. وتختتم بالقول إن الهدف هو التوسع مع إدارة النفقات العامة.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة