أبحاث نماذج اللغة الكبيرة: قائمة 2026 (من يناير إلى مايو)
NVIDIA
Alibaba/Qwen
Mistral
Baidu
Cohere
Technology Innovation Institute
MiniMax
قام سيباستيان راشكا بتجميع قائمة منتقاة من الأبحاث حول نماذج اللغة الكبيرة التي وضع إشارة مرجعية عليها من يناير إلى مايو 2026، تغطي البنية، والتدريب الفعال، والاستدلال، والوكلاء، والمزيد. تتضمن القائمة بنى هجينة مثل (Nemotron 3, Mamba-3)، ونماذج استدلال، وبنية تحتية عملية للخدمة.
اعتاد سيباستيان راشكا على الاحتفاظ بقائمة جارية من الأوراق البحثية التي يرغب في قراءتها أو الاستشهاد بها. بالنسبة للنصف الأول من عام 2026، قام بتجميع قائمة منتقاة من الأوراق التي وضع إشارة مرجعية عليها في الفترة من يناير إلى مايو. القائمة ليست شاملة، لكنها تعكس اهتماماته في نماذج الاستدلال، والتعلم المعزز، والاستدلال الفعال، وأدوات الوكلاء، واستخدام الأدوات، والسياق الطويل، ونماذج اللغة الانتشارية، والبنية التحتية للخدمة العملية. تشمل الفئات: العمارة وتصميم النموذج، والتدريب الفعال والتوسع، وكفاءة الاستدلال وذاكرة التخزين المؤقت للمفاتيح والقيم (KV Cache)، والانتباه المتناثر والسياق الطويل، والاستدلال والحوسبة وقت الاختبار، والتعلم المعزز والتعلم المعزز من التغذية الراجعة البشرية (RLVR)، وأنظمة الوكلاء واستخدام الأدوات، ووكلاء البرمجة وهندسة البرمجيات، ونماذج اللغة الانتشارية، وتقييم النماذج والمعايير. من الأوراق البارزة نموذج Nemotron 3 Super، الذي يستخدم بنية هجينة من Mamba-Transformer لتحقيق الكفاءة، ونموذجا Mamba-3 وGated DeltaNet-2 كبدائل للانتباه. يشير راشكا إلى أن كفاءة السياق الطويل مهمة مع استخدام نماذج اللغة الكبيرة في أنظمة الوكلاء مثل OpenClaw. كما يلاحظ اتجاه البنى الهجينة ذات طبقات الانتباه والطبقات البديلة المتناوبة، كما في Qwen3.6 مع طبقات Gated DeltaNet.
المصدر: Sebastian Raschka —
الأصلي
