DeepSeek يلمح إلى نموذج R2 ويقدم طريقة جديدة لتوسيع نطاق الاستدلال SPCT
نشرت DeepSeek دراسة تقترح طريقة Self-Principled Critique Tuning (SPCT) لتحسين قابلية توسيع نطاق نماذج المكافآت العامة أثناء الاستدلال. وفي الوقت نفسه، ألمحت الشركة إلى الإصدار القادم لنموذجها التالي، R2، الذي من المتوقع أن يعتمد على أساليب التعلم التعزيزي الخالصة.
DeepSeek
OpenAI


