DeepSeek يلمح إلى نموذج R2 ويقدم طريقة جديدة لتوسيع نطاق الاستدلال SPCT
DeepSeek
OpenAI
نشرت DeepSeek دراسة تقترح طريقة Self-Principled Critique Tuning (SPCT) لتحسين قابلية توسيع نطاق نماذج المكافآت العامة أثناء الاستدلال. وفي الوقت نفسه، ألمحت الشركة إلى الإصدار القادم لنموذجها التالي، R2، الذي من المتوقع أن يعتمد على أساليب التعلم التعزيزي الخالصة.
التعلم العميق المعزز أصبح عاملاً رئيسياً في تحسين نماذج اللغة الكبيرة بعد مرحلة ما قبل التدريب، وخاصة في مرحلة الاستدلال. قدمت DeepSeek وباحثون من جامعة تسينغهوا طريقة SPCT (ضبط النقد المبدئي الذاتي)، والتي تتضمن مرحلتين: ضبط الرفض لبداية باردة، مما يسمح للنموذج بتوليد مبادئ ونقد بالتنسيق الصحيح، والتعلم المعزز القائم على القواعد عبر الإنترنت لمزيد من التحسين. يُستخدم أخذ العينات المتوازي لتحقيق التوسع الفعال، ويساعد نموذج المكافأة الفوقية في اختيار أفضل مكافأة. أظهرت التجارب أن SPCT يحسن بشكل كبير جودة وقابلية التوسع لنماذج المكافأة العامة، متفوقاً على الطرق الحالية. في الوقت نفسه، ألمحت الشركة إلى تطوير الجيل التالي من النموذج R2، الذي من المرجح أن يستخدم هذه الابتكارات. كما تشير المقالة إلى أن نموذج التوسع لنماذج اللغة الكبيرة يتحول من ما قبل التدريب إلى ما بعد التدريب ومرحلة الاستدلال، كما أظهر نموذج o1 من OpenAI، الذي يولد سلسلة طويلة من التفكير الداخلي قبل الإجابة.
المصدر: Synced —
الأصلي
