ما وراء نماذج اللغة الكبيرة القياسية: هجينة الانتباه الخطي، انتشار النص، نماذج عالم الكود، ومحولات تكرارية صغيرة
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
المقال بقلم سيباستيان راشكا يستكشف بدائل لنماذج المحولات ذات الانتباه التلقائي القياسية، بما في ذلك هجينة الانتباه الخطي (مثل MiniMax-M1، Qwen3-Next، DeepSeek V3.2، Kimi Linear)، نماذج انتشار النص، نماذج عالم الكود، ومحولات تكرارية صغيرة. ويناقش إحياء آليات الانتباه الخطي والتحديات، مثل عودة MiniMax إلى الانتباه القياسي في نموذجها M2 بسبب الأداء الضعيف في مهام التفكير.
يناقش سيباستيان راشكا بدائل محولات التشفير الذاتي التلقائي القياسية من نوع وحدة فك التشفير (Decoder)، والتي تُبنى على الانتباه متعدد الرؤوس (Multi-Head Attention). تشمل النماذج البارزة نموذج MiniMax-M1 المزود بانتباه برق (Lightning Attention)، ونموذج Qwen3-Next المزود بـ Gated DeltaNet و Gated Attention، ونموذج DeepSeek V3.2 المزود بانتباه متناثر (Sparse Attention)، ونموذج Kimi Linear. ومع ذلك، عادت MiniMax إلى الانتباه العادي في نموذجها M2، مستشهدةً بدقة ضعيفة في مهام التفكير والمهام متعددة الخطوات. يستخدم نموذجا Qwen3-Next و Kimi Linear نسبة 3:1 من الانتباه الخطي (Gated DeltaNet) إلى الانتباه الكامل (Gated Attention). يجمع Gated DeltaNet بين Mamba2 وقاعدة دلتا (Delta Rule) لتحديثات الحالة المتكررة. يذكر المقال أيضًا بدائل أخرى مثل نماذج نشر النص (Text Diffusion Models)، ونماذج العالم البرمجي (Code World Models)، والمحولات المتكررة الصغيرة (Small Recursive Transformers)، لكنه لا يُفصّلها.
المصدر: Sebastian Raschka —
الأصلي
