モデル RSS

研究 🇺🇸

DeepSeekがR2モデルを示唆し、新しい推論スケーリング手法SPCTを導入

DeepSeekは、汎用報酬モデルの推論時のスケーラビリティを向上させるために、自己原則批評チューニング(SPCT)手法を提案する論文を発表しました。同時に、同社は次期モデルR2のリリースを示唆しており、これは純粋な強化学習アプローチに基づくことが期待されています。

DeepSeekDeepSeek OpenAIOpenAI
Synced28.07 · 00:03
モデル 🇨🇳

アリババQwen、Qwen3を発表:ハイブリッド思考、119言語対応、リーダーと競合

アリババQwenはQwen3モデルファミリーを発表しました。フラッグシップのQwen3-235B-A22Bは2350億パラメータ(うち220億がアクティブ)を持ち、DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Proと比較されています。このモデルはハイブリッド思考モード(推論と高速応答)をサポートし、119言語に対応し、エージェント機能とMCP統合が改善されています。8つのモデルの重みがApache 2.0ライセンスで公開されています。

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen28.07 · 00:03
新着ニュース