النماذجالأبحاث 🇺🇸 27.07.2026 18:04

مقارنة بين معماريات نماذج اللغة الكبيرة: من DeepSeek V3 إلى OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
نشر سيباستيان راشكا مقارنة مفصلة لمعماريات نماذج اللغة المفتوحة الحديثة، مسلطًا الضوء على الابتكارات الرئيسية: الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention) ومزيج الخبراء (Mixture-of-Experts) في DeepSeek V3، بالإضافة إلى ميزات التطبيع في OLMo 2. يغطي المقال التطور من GPT-2 إلى نماذج عام 2025.
قدم سيباستيان راشكا نظرة عامة على القرارات المعمارية في نماذج اللغة الكبيرة مفتوحة المصدر الحديثة، مركزًا على قدرات النص وإبقاء تعدد الوسائط خارج نطاق المقالة. في القسم الخاص بـ DeepSeek V3/R1، تم تحليل مكونين رئيسيين بالتفصيل: الانتباه الكامن متعدد الرؤوس (MLA) ومزيج الخبراء (MoE). يعمل MLA على ضغط موترات المفاتيح والقيم في فضاء ذي أبعاد أقل قبل تخزينها في ذاكرة التخزين المؤقت KV، مما يقلل من استخدام الذاكرة، ثم يستعيدها أثناء الاستدلال؛ وفقًا لدراسات الاجتثاث من ورقة DeepSeek-V2، يُظهر MLA جودة نمذجة أفضل من الانتباه القائم على الاستعلامات المجمعة (GQA). يستخدم MoE في DeepSeek V3 256 خبيرًا لكل وحدة، مع تنشيط 9 خبراء فقط (خبير عام وثمانية يختارهم الموجه)، مما يسمح للنموذج الذي يحتوي على 671 مليار معلمة باستخدام 37 مليار معلمة فقط لكل خطوة استدلال. في القسم الخاص بـ OLMo 2، لوحظ أن النموذج من معهد ألين للذكاء الاصطناعي يتميز بالشفافية ويستخدم الانتباه متعدد الرؤوس التقليدي (MHA) بدلاً من MLA أو GQA. الفرق المعماري الرئيسي في OLMo 2 هو ترتيب طبقات التطبيع: فهو يستخدم التطبيع اللاحق (RMSNorm بعد مستويات الانتباه والتغذية الأمامية)، على عكس التطبيع المسبق الأكثر شيوعًا، والذي وفقًا للأبحاث يحسن تقارب التدرجات عند التهيئة.
المصدر: Sebastian Raschka — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة