Adaptive Parallel Reasoning: A New Paradigm for Efficient Scaling of AI Inference
Berkeley Artificial Intelligence Research
Researchers at BAIR analyze the shift from fixed parallel strategies to adaptive parallel reasoning (APR), where the model itself decides when and how to parallelize subtasks. APR reduces the redundancy and latency inherent in sequential reasoning and does not require manual specification of the parallelism structure.
BAIR(Berkeley AI Research)研究所が新しいアプローチである適応的並列推論(Adaptive Parallel Reasoning, APR)の概要を発表しました。これは、AIモデルがタスクを並列サブタスクに分割するタイミング、スレッド数、および調整方法を自律的に決定できるようにするものです。自己無撞着性(Self-Consistency)やベスト・オブ・N(Best-of-N)などの従来手法は固定の並列構造を使用するため、冗長な計算が発生します。一方、思考の木(Tree-of-Thoughts)やモンテカルロ木探索(Monte-Carlo Tree Search, MCTS)などのアプローチは、事前に定義された分解用ヒューリスティックを必要とします。APRは、モデルが強化学習により、逐次的に推論すべきか並列的に推論すべきかを決定する特別な制御トークンを生成するように学習することで、この考え方を一般化します。これにより、問題の複雑さに応じて動的に並列度を適応させ、簡単な質問では冗長性を回避し、難しい質問では適切な分解を実現します。並列ブランチの実行には、フォーク・ジョイン(fork-join)アーキテクチャを使用します。モデルはサブタスクを生成し、それらを並列に処理した後、結果を統合します。KVキャッシュ(Key-Value Cache)の効率的な管理のために、Multiverse、Parallel-R1、NPRなどの推論エンジンの変更が適用され、独立したスレッドからのKVキャッシュをコピーして単一のシーケンスに結合します。ただし、これにはエンジンの変更が必要であり、不安定性を引き起こす可能性があります。別のアプローチとして、エンジン変更を必要としないユニバーサルレンダラーを使用する方法があります。全体として、APRは、遅延の線形増加や「コンテキスト劣化」による品質低下なしに推論時間を拡張できる新しいパラダイムと見なされています。
出典: BAIR (Berkeley AI) —
原文
