適応型並列推論:効率的なAI推論スケーリングの新しいパラダイム
Berkeley Artificial Intelligence Research
Adaptive Parallel Reasoning (APR) は、LLMが推論サブタスクをいつどのように並列化するかを動的に決定するパラダイムであり、冗長な計算を回避し効率を向上させます。固定並列化手法とは異なり、APRはモデルが問題ごとに分解戦略、スレッド数、調整方法を選択できるようにし、強化学習と特別な制御トークンを活用します。
BAIRブログ記事では、LLM推論を効率的に拡張するパラダイムとして適応的並列推論(Adaptive Parallel Reasoning, APR)が紹介されています。従来の逐次推論では探索に比例して線形に計算量が増加し、レイテンシやコンテキストローテーションの問題が発生します。既存の並列手法(自己無撞着性、Tree-of-Thoughts、モンテカルロ木探索など)は固定された並列構造を強制するため、単純な問題で計算リソースが無駄になります。Panら(2025)が提唱するAPRは、強化学習を通じてモデルに特殊なトークンを出力させるよう訓練し、それらのトークンで並列推論と逐次推論を切り替えるタイミングを制御します。ThreadWeaver(Lianら, 2025)はAPRの一手法です。推論実行はfork-joinデザインを採用し、Multiverseのように推論エンジンを変更して合成時にKVキャッシュを再利用するアプローチや、ブランチデコーディングベースの手法のようにエンジン変更を伴わないアプローチがあります。主な利点は、ドメイン固有のヒューリスティックが不要、冗長性の低減、タスクの複雑さに応じた適応的な並列化です。
出典: BAIR (Berkeley AI) —
原文
