推論時スケーリングのカテゴリ:LLM推論改善のための手法
OpenAI
推論時スケーリングは、推論により多くの計算リソースを使用することで、LLMの回答品質を向上させます。本記事では手法を分類し、最近の論文をレビューすることで、主要なLLMプロバイダがこのような手法に依存していることを示します。
推論時スケーリングは、推論時に追加の計算リソースを割り当てることで大規模言語モデルの性能を向上させる主要な手法となっています。本記事では、チェーン・オブ・ソート(Chain-of-Thought)プロンプティング、自己無撞着性(Self-Consistency)、ベスト・オブ・N(Best-of-N)ランキング、検証器を用いたリジェクション・サンプリング(Rejection Sampling with a Verifier)、自己改良(Self-Refinement)、および解経路の探索(Search Over Solution Paths)などのカテゴリに手法を分類しています。また、最近の論文を概観し、プロプライエタリな大規模言語モデルがこれらの手法を採用していることにも言及しています。著者は、このトピックに関する書籍の一章を二部に分割し、アーリーアクセスで公開しており、最終章に収まりきらなかった追加のアイデアやメモも共有しています。
出典: Sebastian Raschka —
原文
