الأبحاثالنماذج 🇺🇸 28.07.2026 00:03

DeepSeek تلمح إلى نموذج R2 وتقدم طريقة تحجيم استدلال جديدة SPCT

DeepSeekDeepSeek OpenAIOpenAI
نشرت DeepSeek AI ورقة بحثية حول تحجيم وقت الاستدلال لنماذج المكافآت العامة، حيث قدمت SPCT (ضبط النقد الذاتي المبدئي). تلمح الشركة إلى نموذجها القادم R2. يعالج البحث ندرة المكافآت ويهدف إلى تحسين قابلية تحجيم نماذج المكافآت أثناء الاستدلال.
نشرت شركة DeepSeek للذكاء الاصطناعي ورقة بحثية بعنوان "توسيع النطاق الزمني للاستدلال لنمذجة المكافآت العامة"، قدمت فيها طريقة جديدة تُسمى "ضبط النقد القائم على المبادئ الذاتية" (Self-Principled Critique Tuning - SPCT). تعزز SPCT نماذج المكافآت العامة (General Reward Models - GRMs) من خلال توليد مبادئ ونقد ديناميكيًا عبر ضبط الرفض والتعلم التعزيزي القائم على القواعد عبر الإنترنت. تهدف هذه المقاربة إلى تحسين قابلية التوسع أثناء مرحلة الاستدلال، ومعالجة ندرة المكافآت - وهي عقبة رئيسية في توسيع نطاق التعلم التعزيزي لنماذج اللغات الكبيرة (Large Language Models - LLMs). أثبتت سلسلة R1 من DeepSeek بالفعل فعالية التدريب التعزيزي الخالص؛ وتلمح الشركة الآن إلى نموذج الجيل التالي R2، الذي يُتوقع أن يبني على هذه التطورات. يأتي التحول في توسيع نطاق نماذج اللغات الكبيرة من مرحلة ما قبل التدريب إلى مرحلة ما بعد التدريب، خاصة مرحلة الاستدلال، بعد نماذج مثل o1 من OpenAI، الذي يستخدم تفكيرًا تسلسليًا داخليًا مكثفًا في سلسلة الأفكار (chain-of-thought).
المصدر: Synced — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة