研究モデル 🇺🇸 27.07.2026 20:04

Managing Reasoning Levels in Large Language Models

OpenAIOpenAI DeepSeekDeepSeek Moonshot AIMoonshot AI
Sebastian Raschka explains how reasoning modes of varying complexity (low, medium, high) work in large language models. He discusses reinforcement learning methods with verifiable rewards, as well as mechanisms for switching between modes, including approaches used in models like DeepSeek-R1, Qwen3, and GPT-5.6.
著者は、LLMがどのようにして様々な努力レベルで推論することを学習するかについて、2年前のOpenAI o1モデルの登場から始まり、その後RLVRトレーニング手法を採用したDeepSeek-R1に至るまで説明しています。最近、OpenAIはGPT-5.6ファミリーをリリースしました。このファミリーには3つのサイズと、約5~6種類の推論努力設定が含まれています。論文では推論モデルの簡単な定義が示されています。すなわち、それらは中間推論の軌跡(トレース)を出力し、問題をステップバイステップで処理します。性能向上のための2つの方法、すなわちトレーニングスケーリング(training scaling)と推論スケーリング(inference scaling)について議論されています。トレーニングではRLVRが使用され、検証可能な領域(数学、コード)において回答の正しさに応じて報酬が与えられます。DeepSeek-R1は、完全なパイプラインは多段階であるものの、このような動作が純粋なRLによって達成されることを示しました。また、<think>タグと</think>タグについても考察されています。これらは単に推論トレースの境界を示すものであり、モデルに思考能力を与えるものではありません。Qwen3の例を通して、トークナイザー(enable_thinking)を介した推論モードの有効化/無効化がどのように実装されているかが示されています。最後に、GPT-5.6における推論努力設定がどのように実装される可能性があるかについて議論されています。おそらく、システムプロンプトを通じて回答の長さと精度に影響を与える形になるでしょう。
出典: Sebastian Raschka — 原文
関連記事 ↓
新着ニュース