الأبحاثالنماذج 🇺🇸 27.07.2026 18:04

تقرير تقني جديد عن DeepSeek-V3: كيف يمكن للتصميم المشترك بين العتاد والبرمجيات تمكين التدريب منخفض التكلفة للنماذج الكبيرة

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
تم إصدار تقرير تقني جديد من 14 صفحة من فريق DeepSeek-V3، شارك في تأليفه الرئيس التنفيذي لـ DeepSeek، وينفينغ ليانغ. يحلل المستند تحديات توسيع نطاق نماذج اللغة الكبيرة ودور البنية التحتية للعتاد، ويقترح حلولاً تستند إلى التصميم المشترك بين النماذج والعتاد للتدريب والاستدلال بتكلفة فعالة.
أصدر فريق DeepSeek-V3 تقريرًا فنيًا جديدًا، وُرد اسم الرئيس التنفيذي للشركة ونفنغ ليانغ كمؤلف مشارك فيه. تتكون الوثيقة من 14 صفحة وتتناول مشكلات توسيع نطاق نماذج اللغات الكبيرة (LLM) وانعكاس القيود المادية. على عكس المنشور السابق الذي وصف بنية V3، يركز التقرير الجديد على العلاقة المتبادلة بين تطوير النماذج وأجهزتها. تم تدريب DeepSeek-V3 على مجموعة من 2048 وحدة معالجة رسومية NVIDIA H800، وهو مثال على كيف يمكن لمراعاة خصائص "العتاد" التغلب على الاختناقات - نقص الذاكرة، وكفاءة الحوسبة، وعرض نطاق الربط البيني. من بين القرارات المعمارية الرئيسية: آلية الانتباه متعدد الرؤوس الكامن (Multi-head Latent Attention - MLA) التي تضغط مخبأ المفاتيح والقيم إلى 70 كيلوبايت لكل رمز (مقابل 516 كيلوبايت في LLaMA-3.1 405B و327 كيلوبايت في Qwen-2.5 72B). يتم تحقيق توفير الحوسبة من خلال البنية المتناثرة DeepSeekMoE: النموذج الذي يحتوي على 671 مليار معلمة ينشط فقط 37 مليارًا لكل رمز، مما يتطلب حوالي 250 جيجافلوبس لكل رمز مقابل 394 في Qwen-2.5 72B و2448 في LLaMA-3.1 405B. لتسريع الاستدلال، يتم استخدام بنية مزدوجة للدفعات الصغيرة (dual microbatch architecture) تتداخل فيها الاتصالات مع العمليات الحسابية، بالإضافة إلى الفصل بين مرحلتي التعبئة المسبقة (prefill) وفك الترميز (decode). أصبحت DeepSeek-V3 أول نموذج كبير معروف علنًا يتم تدريبه باستخدام الدقة المختلطة FP8، مما قلل التكاليف الحسابية. للتبادل بين العقد، يتم ضغط البيانات باستخدام FP8 (LogFMT)، مما يخفض حجم الاتصالات إلى النصف. بسبب القيود التنظيمية، تمتلك NVIDIA H800 عرض نطاق NVLink أقل بمرتين (400 جيجابايت/ثانية مقابل 900)، لذلك طبقت DeepSeek "توجيهًا متمركزًا حول العقدة" لخبراء MoE، حيث قامت بتجميع الخبراء في 8 مجموعات كل منها 32 على عقدة واحدة، وتحديد عدد العقد المستقبلة لكل رمز بأربع عقد. يناقش التقرير أيضًا الاتجاهات المستقبلية: دمج scale-up وscale-out في ناقل واحد (UB)، وإدخال معالجات مساعدة متخصصة لحركة مرور الشبكة، والإدارة الديناميكية لعرض نطاق NVLink/PCIe، واستخدام طوبولوجيا Multi-Plane Fat-Tree.
المصدر: Synced — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة