تقرير تقني جديد حول DeepSeek-V3: كيف يمكن التصميم المشترك للعتاد والبرمجيات من تقليل تكلفة تدريب النماذج الكبيرة

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
ورقة تقنية جديدة من فريق DeepSeek، بمشاركة الرئيس التنفيذي وينفينغ ليانغ كمؤلف مشارك، تستكشف التصميم المشترك للنموذج مع awareness بالعتاد لتقليل تكاليف تدريب نماذج اللغة الكبيرة. تستخدم الورقة نموذج DeepSeek-V3 المدرب على 2048 وحدة معالجة NVIDIA H800 كدراسة حالة، وتفصل الابتكارات في كفاءة الذاكرة (MLA)، والحساب المتفرق (DeepSeekMoE)، والتدريب بدقة FP8، والتوجيه المراعي للاتصالات البينية.
الورقة المكونة من 14 صفحة، 'تحديات التوسع وتأملات حول العتاد لمعماريات الذكاء الاصطناعي'، تحلل كيف تشكل قيود العتاد (الذاكرة، الحوسبة، عرض نطاق الترابط) تصميم نماذج اللغة الكبيرة. يستخدم نموذج DeepSeek-V3 الانتباه الكامن متعدد الرؤوس (Multi-head Latent Attention - MLA) لضغط ذاكرة التخزين المؤقت KV إلى 70 كيلوبايت لكل رمز مقابل 516 كيلوبايت لنموذج LLaMA-3.1 405B. تعمل معمارية DeepSeekMoE على تنشيط 37 مليارًا فقط من 671 مليار معلمة لكل رمز، مما يقلل عمليات الفاصلة العائمة (FLOPs) لكل رمز إلى حوالي 250 جيجا فلوب مقابل 394 لنموذج Qwen2.5-72B و2448 لنموذج LLaMA-3.1 405B. يستخدم النموذج تدريبًا بدقة مختلطة من نوع FP8 وتواصلًا منخفض الدقة من نوع LogFMT، مما يقلل حجم الاتصال بنسبة 50% مقارنة بـ BF16. للتخفيف من عرض نطاق NVLink المخفض في معالج NVIDIA H800 (400 جيجابايت/ثانية مقابل 900 جيجابايت/ثانية في H800)، تقوم التوجيه المدرك للعقدة بتجميع 256 خبيرًا في 8 مجموعات محلية للعقدة، مما يحد من كل رمز إلى 4 عقد كحد أقصى. تدعو الورقة إلى ترابط موحد للتوسع الرأسي والأفقي ومعالجات اتصال مخصصة.
المصدر: Synced — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة