حالة نماذج اللغة الكبيرة في 2025: التقدم، التحديات، والتوقعات
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
في عام 2025، هيمنت نماذج الاستدلال التي تستخدم التعلم المعزز بالمكافآت القابلة للتحقق (RLVR) وخوارزمية GRPO، التي أطلقها DeepSeek R1، على تطوير نماذج اللغة الكبيرة. تشمل الاتجاهات الرئيسية التركيز على قياس وقت الاستدلال، وهندسات Mixture of Experts، وتحسينات الكفاءة مثل Gated DeltaNets. أبرزت الأبحاث الأكاديمية متغيرات GRPO مع تحسينات مثل تصفية التدرج الصفري وفقدان على مستوى الرمز.
مع انتهاء عام 2025، هيمنت على العام نماذج التفكير التي تستخدم التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) والتحسين الاستراتيجي بالاعتماد على المجموعات النسبية العامة (GRPO)، وذلك بعد إصدار DeepSeek R1 في يناير. أظهر DeepSeek R1 أن سلوك التفكير يمكن تطويره باستخدام التعلم التعزيزي، وكان أداء نموذجه مفتوح الأوزان مشابهًا للنماذج المملوكة. كما أثارت الورقة جدلاً حول تكاليف التدريب، حيث بلغت تقديرات التكلفة حوالي 5 ملايين دولار للتشغيل النهائي، باستثناء رواتب الباحثين. تستخدم RLVR مكافآت قابلة للتحقق (مثل الرياضيات، البرمجة) في مرحلة ما بعد التدريب، مما يقلل الاعتماد على التصنيفات البشرية المكلفة. أصدر كل مطور رئيسي لنماذج اللغة الكبيرة نسخة تفكيرية. نقاط التركيز الأخرى: عام 2022: التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) مع تحسين السياسة القريبة (PPO)، 2023: الضبط الدقيق الفعال للمعاملات منخفضة الرتبة (LoRA) مع الضبط الدقيق الخاضع للإشراف (SFT)، 2024: التدريب المتوسط. تشمل التوقعات لعامي 2026-2027 توسعات لـ RLVR، وتوسيع نطاق وقت الاستدلال، والتعلم المستمر. أصبحت GRPO محط اهتمام البحوث، مع العديد من التحسينات الرياضية مثل ترشيح التدرج الصفري، وأخذ العينات النشط، وفقدان على مستوى الرمز، وعدم فقدان تباعد كولباك-ليبلر (KL)، مما يحسن استقرار التدريب بشكل كبير. من الناحية المعمارية، لا تزال النماذج المتطورة تستخدم محولات من نوع وحدة فك الترميز مع طبقات خليط الخبراء (MoE) وانتباه محسّن من حيث الكفاءة (انتباه المجموعة-الاستعلام، النافذة المنزلقة، الانتباه الكامن متعدد الرؤوس). تتضمن تحسينات الكفاءة الأحدث شبكات دلتا المقيدة (Gated DeltaNets) في Qwen3-Next وKimi Linear، وطبقات Mamba-2 في نموذج Nemotron 3 من NVIDIA.
المصدر: Sebastian Raschka —
الأصلي
