研究モデル 🇺🇸 28.07.2026 00:03

DeepSeekがR2モデルを示唆、新推論スケーリング手法SPCTを発表

DeepSeekDeepSeek OpenAIOpenAI
DeepSeek AIは、汎用報酬モデルの推論時スケーリングに関する論文を発表し、SPCT(Self-Principled Critique Tuning)を導入しました。同社は次期R2モデルを示唆しています。この研究は報酬のスパース性に対処し、推論時の報酬モデルのスケーラビリティ向上を目指しています。
DeepSeek AI は、'推論時のスケーリングによる汎用報酬モデリング' と題した論文を発表し、Self-Principled Critique Tuning(SPCT、自己原則的批評チューニング)と呼ばれる新しい手法を紹介しました。SPCT は、棄却ファインチューニングとルールベースのオンライン強化学習を通じて、動的に原則と批評を生成することで、汎用報酬モデル(GRM)を強化します。このアプローチは、推論時のスケーラビリティを向上させ、LLM の強化学習のスケーリングにおける大きな障壁である報酬の希少性に対処することを目的としています。DeepSeek の R1 シリーズはすでに純粋な強化学習トレーニングの有効性を証明しており、同社は現在、これらの進歩を基盤とする次世代モデル R2 を示唆しています。LLM のスケーリングが事前トレーニングからポストトレーニング、特に推論段階へとシフトする流れは、広範な内部連鎖思考(chain-of-thought)推論を用いる OpenAI の o1 のようなモデルに続くものです。
出典: Synced — 原文
関連記事 ↓
新着ニュース