مقارنة بين بنى نماذج اللغة الكبيرة: من DeepSeek V3 إلى OLMo 2
DeepSeek
Allen Institute for AI
يقارن سيباستيان راشكا بين بنى نماذج اللغة الكبيرة الحديثة، بما في ذلك DeepSeek V3 مع الانتباه الكامن متعدد الرؤوس وخبراء المزيج، وOLMo 2 من معهد ألين للذكاء الاصطناعي مع التطبيع اللاحق وتطبيع QK. تغطي المقالة القرارات المعمارية الرئيسية مثل الانتباه الجماعي الاستعلامي ومخططات التطبيع المختلفة.
في مقاله، يفحص سيباستيان راشكا السمات المعمارية لنماذج اللغة الكبيرة الحديثة، مقارنًا بين DeepSeek V3/R1 وOLMo 2 وغيرهما. يستخدم DeepSeek V3 الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention - MLA)، الذي يضغط المفاتيح والقيم في فضاء منخفض الأبعاد لتوفير ذاكرة التخزين المؤقت KV، وخبراء مختلط (Mixture-of-Experts - MoE) مع 256 خبيرًا، يتم تنشيط 9 منها فقط (خبير مشترك واحد و8 يختارها الموجه)، مما يسمح له باستخدام 37 مليار معامل فقط لكل خطوة على الرغم من امتلاكه 671 مليار معامل إجمالاً. من ناحية أخرى، يستخدم OLMo 2 من معهد ألين للذكاء الاصطناعي (Allen Institute for AI) الانتباه متعدد الرؤوس التقليدي، لكن مع تطبيع ما بعدي (Post-Norm) (RMSNorm بعد طبقات الانتباه والشبكة الأمامية) وتطبيع QK لتحقيق استقرار التدريب. كما يذكر المقال انتباه الاستعلام المجمع (Grouped-Query Attention) كبديل للانتباه متعدد الرؤوس المستخدم في نماذج أخرى.
المصدر: Sebastian Raschka —
الأصلي
