研究模型 🇺🇸 27.07.2026 14:04

自适应并行推理:高效人工智能推理扩展的新范式

Berkeley Artificial Intelligence ResearchBerkeley Artificial Intelligence Research
自适应并行推理(APR)是一种范式,其中大语言模型学会动态决定何时以及如何并行化推理子任务,避免冗余计算并提高效率。与固定并行度方法不同,APR允许模型根据问题选择分解策略、线程数量和协调方式,利用强化学习和特殊控制令牌。
BAIR博客文章介绍了自适应并行推理(APR)作为一种高效扩展大语言模型推理的范式。传统顺序推理随搜索范围扩大而线性增加延迟,并引发上下文错位问题。现有的并行方法(如自我一致性、思维树或蒙特卡洛树搜索)采用固定的并行结构,在简单问题上浪费计算资源。由潘等人(2025年)首创的APR,通过强化学习训练模型输出特殊标记,以控制何时进行并行或顺序推理。ThreadWeaver(连等人,2025年)是APR的一种方法。推理执行采用分叉-合并设计,其中Multiverse等方法修改推理引擎以在合成阶段复用键值缓存,而基于分支解码的方法则避免修改引擎。主要优势:无需领域特定启发式规则、减少冗余、并根据任务复杂度自适应并行度。
来源: BAIR (Berkeley AI) — 原文
我们之前关于此话题的帖子 ↓
最新新闻