推論AIモデル:その仕組みと重要性
OpenAI
Anthropic
Google/DeepMind
DeepSeek
大規模推論モデル(LRM)は人間のスローシンキングを模倣し、複雑な問題解決において従来の大規模言語モデル(LLM)を凌駕します。その動作は、チェーン・オブ・ソート推論、推論中の追加計算、強化学習に基づいています。印象的な成果が得られているものの、汎用人工知能(AGI)への道は依然として開かれています。
2024年秋、OpenAIは話題となったo1モデルを発表しました。AIME数学試験では、単一回答モードで74%、コンセンサス選択で最大93%のスコアを達成し、一方GPT-4oは問題の12%しか正解できませんでした。GPQA Diamondベンチマークでは、o1は78%を達成し、平均的な専門家を上回りました。これらの結果は、カーネマンが提唱する遅い「システム2」思考を模倣したラージ・リーズニング・モデル(LRM)の能力を示しています。LRMに分類される他のモデルには、Anthropicの(Claude Fable 5、Mythos 5、Opus 4.8)、GoogleのGemini 3.1 Pro、DeepSeek R1、GLM-5.2などがあります。高速な「システム1」として動作する従来の自己回帰型大規模言語モデル(LLM)とは異なり、推論モデルは思考連鎖、推論時における追加計算(テスト時計算)、および強化学習を使用します。ユーザーには見えない推論トークンを生成するため、リクエスト処理時間が1分以上に延びることがあります。研究によると、「より長く考える」戦略は単にモデルサイズを拡大するよりも効果的であり、モデルは十分な思考時間を与えられれば、14倍大きいLLMと同等のパフォーマンスを発揮できます。中国のDeepSeek-R1は、外部の「批評家」を排除し、推論をモデル自体に直接統合しました。
出典: 3DNews —
原文
