Allen Institute for AI

أحدث أخبار ونماذج وإصدارات الذكاء الاصطناعي من Allen Institute for AI. ['MolmoAct2', 'OLMo 2', 'OLMo 2 7B', 'OLMo 3', 'OLMo 3 7B', 'Tülu 3']

النماذج 🇺🇸

مقارنة بين معماريات نماذج اللغة الكبيرة: من DeepSeek V3 إلى OLMo 2

نشر سيباستيان راشكا مقارنة مفصلة لمعماريات نماذج اللغة المفتوحة الحديثة، مسلطًا الضوء على الابتكارات الرئيسية: الانتباه الكامن متعدد الرؤوس (Multi-Head Latent Attention) ومزيج الخبراء (Mixture-of-Experts) في DeepSeek V3، بالإضافة إلى ميزات التطبيع في OLMo 2. يغطي المقال التطور من GPT-2 إلى نماذج عام 2025.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
الأبحاث 🇺🇸

ما وراء النماذج اللغوية الكبيرة القياسية: مزيج الانتباه الخطي، نماذج نشر النص، نماذج عالم الكود، والمحولات المتكررة الصغيرة

يستكشف المقال بدائل للنماذج اللغوية الكبيرة القياسية القائمة على المحولات ذاتية التغذية الراجعة: مزيج الانتباه الخطي (MiniMax-M1، Qwen3-Next، DeepSeek V3.2، Kimi Linear)، نماذج نشر النص، نماذج عالم الكود، والمحولات المتكررة الصغيرة. يلاحظ المؤلف عودة إلى الانتباه الكلاسيكي في MiniMax-M2 وتعقيد الانتباه الخطي في الإنتاج.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Sebastian Raschka27.07 · 17:04
أخبار جديدة