Адаптивное параллельное рассуждение: новая парадигма эффективного масштабирования вывода ИИ
Berkeley Artificial Intelligence Research
Адаптивное параллельное рассуждение (Adaptive Parallel Reasoning, APR) — это парадигма, в которой большие языковые модели (LLM) учатся динамически решать, когда и как распараллеливать подзадачи рассуждения, избегая избыточных вычислений и повышая эффективность. В отличие от методов фиксированного параллелизма, APR позволяет моделям выбирать стратегии декомпозиции, количество потоков и координацию для каждой задачи, используя обучение с подкреплением и специальные управляющие токены.
В блоге BAIR представлена адаптивная параллельная обработка рассуждений (APR) как парадигма для эффективного масштабирования инференса LLM. Традиционные последовательные рассуждения масштабируются линейно с объёмом поиска, что приводит к проблемам с задержкой и контекстным окном. Существующие параллельные методы, такие как самосогласованность, деревья мыслей (tree-of-thoughts) или метод
Показать ещё ↓
Источник: BAIR (Berkeley AI) —
оригинал
