自适应并行推理:高效扩展AI推理的新范式
Berkeley Artificial Intelligence Research
伯克利人工智能研究中心(BAIR)的研究人员分析了从固定并行策略向自适应并行推理(APR)的转变,在这种新范式中,模型自身决定何时以及如何并行化子任务。APR减少了顺序推理中固有的冗余和延迟,并且不需要手动指定并行结构。
BAIR实验室(伯克利人工智能研究)发布了一项新方法综述——自适应并行推理(APR),该方法让AI模型自主决定何时将任务分解为并行子任务、启动多少个线程以及如何协调它们。传统方法如自一致性或最佳N选一使用固定的并行结构,导致计算冗余。其他方法,例如思维树或蒙特卡洛树搜索(MCTS),需要预先设定启发式规则进行分解。APR对此进行了泛化:模型通过强化学习训练生成特殊的控制令牌,这些令牌决定何时顺序推理、何时并行推理。这样就能根据任务复杂度动态调整并行度,避免简单问题上的冗余,并在复杂问题上确保正确分解。并行分支的执行采用分叉-合并架构:模型生成子任务,这些子任务并行处理,然后结果被合并。为了高效管理键值缓存,采用了诸如Multiverse、Parallel-R1和NPR等推理引擎修改方案,这些方案将独立流中的键值缓存复制并拼接成单一序列。然而,这需要对引擎进行修改,并可能导致不稳定。另一种方法则是使用无需修改引擎的通用渲染器。总体而言,APR被视为一种新范式,它能在不线性增加延迟也不因“上下文退化”而损失质量的情况下,扩展推理时间。
来源: BAIR (Berkeley AI) —
原文
