연구모델 🇺🇸 27.07.2026 14:04

Adaptive Parallel Reasoning: A New Paradigm for Efficient Scaling of AI Inference

Berkeley Artificial Intelligence ResearchBerkeley Artificial Intelligence Research
Researchers at BAIR analyze the shift from fixed parallel strategies to adaptive parallel reasoning (APR), where the model itself decides when and how to parallelize subtasks. APR reduces the redundancy and latency inherent in sequential reasoning and does not require manual specification of the parallelism structure.
Лаборатория BAIR (Berkeley AI Research) представила обзор нового подхода — адаптивного параллельного рассуждения (APR), который позволяет моделям ИИ самостоятельно решать, когда разбивать задачу на параллельные подзадачи, сколько потоков запускать и как их координировать. Традиционные методы, такие как самосогласованность (self-consistency) или лучший из N (best-of-N), используют фиксированную структуру параллелизма, что приводит к избыточным вычислениям. Другие подходы, например дерево мыслей (Tree-of-Thoughts) или поиск по дереву Монте-Карло (Monte-Carlo Tree Search), требуют заранее заданных эвристик для декомпозиции. APR обобщает идею: модель обучается с помощью подкрепления генерировать специальные управляющие токены, которые определяют, когда рассуждать последовательно, а когда — параллельно. Это позволяет динамически адаптировать уровень параллелизма под сложность задачи, избегая избыточности на простых вопросах и обеспечивая правильную декомпозицию на сложных. Для выполнения параллельных ветвей используется архитектура вилка-слияние (fork-join): модель порождает подзадачи, которые обрабатываются параллельно, а затем результаты объединяются. Для эффективного управления кэшем ключей-значений (KV cache) применяются модификации движка вывода, такие как Multiverse, Parallel-R1 и NPR, которые копируют и склеивают KV cache из независимых потоков в единую последовательность. Однако это требует изменений в движке и может приводить к нестабильности. Альтернативный подход — использование универсальных рендеров, которые обходятся без модификации движка. В целом APR рассматривается как новая парадигма, позволяющая масштабировать время рассуждения без линейного роста задержки и потери качества из-за «контекстного разложения».
출처: BAIR (Berkeley AI) — 원문
관련 게시물 ↓
새로운 뉴스