ما وراء النماذج اللغوية الكبيرة القياسية: مزيج الانتباه الخطي، نماذج نشر النص، نماذج عالم الكود، والمحولات المتكررة الصغيرة
يستكشف المقال بدائل للنماذج اللغوية الكبيرة القياسية القائمة على المحولات ذاتية التغذية الراجعة: مزيج الانتباه الخطي (MiniMax-M1، Qwen3-Next، DeepSeek V3.2، Kimi Linear)، نماذج نشر النص، نماذج عالم الكود، والمحولات المتكررة الصغيرة. يلاحظ المؤلف عودة إلى الانتباه الكلاسيكي في MiniMax-M2 وتعقيد الانتباه الخطي في الإنتاج.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA

