DeepSeekがR2モデルを示唆し、新しい推論スケーリング手法SPCTを導入
DeepSeekは、汎用報酬モデルの推論時のスケーラビリティを向上させるために、自己原則批評チューニング(SPCT)手法を提案する論文を発表しました。同時に、同社は次期モデルR2のリリースを示唆しており、これは純粋な強化学習アプローチに基づくことが期待されています。
DeepSeek
OpenAI
Synced28.07 · 00:03
DeepSeekは、汎用報酬モデルの推論時のスケーラビリティを向上させるために、自己原則批評チューニング(SPCT)手法を提案する論文を発表しました。同時に、同社は次期モデルR2のリリースを示唆しており、これは純粋な強化学習アプローチに基づくことが期待されています。
DeepSeek
OpenAI
アリババQwenはQwen3モデルファミリーを発表しました。フラッグシップのQwen3-235B-A22Bは2350億パラメータ(うち220億がアクティブ)を持ち、DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Proと比較されています。このモデルはハイブリッド思考モード(推論と高速応答)をサポートし、119言語に対応し、エージェント機能とMCP統合が改善されています。8つのモデルの重みがApache 2.0ライセンスで公開されています。
Alibaba/Qwen