مقارنة بين معماريات نماذج اللغة الكبيرة: من DeepSeek V3 إلى OLMo 2
نشر سيباستيان راشكا مقارنة مفصلة لمعماريات نماذج اللغة المفتوحة الحديثة، مسلطًا الضوء على الابتكارات الرئيسية: الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention) ومزيج الخبراء (Mixture-of-Experts) في DeepSeek V3، بالإضافة إلى ميزات التطبيع في OLMo 2. يغطي المقال التطور من GPT-2 إلى نماذج عام 2025.
DeepSeek
Allen Institute for AI











