مسح لأوراق بحثية حول نماذج اللغة الكبيرة للنصف الأول من عام 2026
NVIDIA
Alibaba/Qwen
Mistral
Baidu
Cohere
Technology Innovation Institute
MiniMax
نشر سيباستيان راشكا قائمة منسقة من الأوراق العلمية الرئيسية حول نماذج اللغة الكبيرة من يناير إلى مايو 2026. يسلط الاختيار الضوء على الاتجاهات: البنى الهجينة (تبادل طبقات الانتباه وطبقات فضاء الحالة)، والاستدلال الفعال، والأنظمة الوكيلة، ونماذج اللغة الانتشارية. يتم إيلاء اهتمام خاص لـ Nvidia's Nemotron 3 بتصميم هجين و Qwen3.6 مع Gated DeltaNet.
أعد سيباستيان راشكا، الخبير المعروف في التعلم الآلي، مجموعة من الأوراق البحثية حول نماذج اللغة الكبيرة (Large Language Models - LLMs) للنصف الأول من عام 2026، والتي اختارها لنفسه. تم تنظيم القائمة حسب الفئات: الهندسة والتصميم، التدريب الفعال والتوسع، كفاءة الاستدلال وذاكرة التخزين المؤقت KV، الانتباه المتفرق والسياق الطويل، الاستدلال والتكاليف الحسابية في وقت الاختبار، التعلم المعزز و RLVR، الأنظمة الوكيلة واستخدام الأدوات، وكلاء البرمجة وهندسة البرمجيات، نماذج اللغة الانتشاريّة، التقييم والمعايير. في عام 2026، ووفقًا للمؤلف، أصبحت الاتجاهات الرئيسية هي الهندسات الهجينة (على سبيل المثال، Nemotron 3 من Nvidia، الذي يجمع بين طبقات الانتباه و Mamba-2)، ونماذج فضاء الحالة (Mamba-3)، والتوزيع الفعال للخبراء في نماذج خليط الخبراء (MoE)، وتحليل التنشيطات (The Spike, the Sparse and the Sink) وهندسة التمثيلات. تم تمييز نماذج Qwen3.6 مع Gated DeltaNet بشكل خاص، بالإضافة إلى إصدارات Nemotron 3 Nano (4B) و Nemotron 3 Ultra (550B-A55B). كما تضمنت القائمة أعمالاً حول التنبؤ متعدد الرموز، والبيانات التركيبية، والتكميم بعد التدريب.
المصدر: Sebastian Raschka —
الأصلي
