DeepSeek 暗示 R2 模型并引入新推理扩展方法 SPCT
DeepSeek
OpenAI
DeepSeek AI 发表了一篇关于通用奖励模型推理时扩展的论文,介绍了 SPCT(自原则批评调优)。该公司暗示了即将推出的 R2 模型。该研究解决了奖励稀疏性问题,旨在提高奖励模型在推理过程中的可扩展性。
DeepSeek AI 发布了一篇题为《推理阶段可扩展的通用奖励建模》(Inference-Time Scaling for Generalist Reward Modeling)的论文,提出了一种名为“自我原则性批判调优”(Self-Principled Critique Tuning,简称 SPCT)的新方法。SPCT 通过拒绝式微调(rejection fine-tuning)和基于规则的在线强化学习,动态生成评判原则与批判内容,从而增强通用奖励模型(General Reward Model,简称 GRM)的能力。该方法旨在提升推理阶段的可扩展性,解决奖励稀疏问题——这是在大型语言模型(Large Language Model,简称 LLM)中扩展强化学习训练时面临的主要难题之一。DeepSeek 的 R1 系列此前已验证了纯强化学习训练的可行性,如今该公司也暗示了下一代模型 R2 的存在,预计将在这些进展的基础上进一步演进。大型语言模型的扩展重点正从预训练阶段转向后训练阶段,尤其是推理阶段的优化,这一趋势与 OpenAI 的 o1 等模型的路线相呼应,后者依赖大量内部的思维链(chain-of-thought)推理机制。
来源: Synced —
原文
