Raciocínio Paralelo Adaptativo: Um Novo Paradigma para a Escalabilidade Eficiente da Inferência de IA
Berkeley Artificial Intelligence Research
O Raciocínio Paralelo Adaptativo (RPA) é um paradigma no qual os modelos de linguagem de grande escala (LLMs) aprendem a decidir dinamicamente quando e como paralelizar subtarefas de raciocínio, evitando computação redundante e melhorando a eficiência. Diferentemente dos métodos de paralelismo fixo, o RPA permite que os modelos escolham estratégias de decomposição, contagem de threads e coordenação por problema, aproveitando aprendizado por reforço e tokens de controle especiais.
O post do blog BAIR apresenta o Raciocínio Paralelo Adaptativo (APR) como um paradigma para escalar a inferência de LLMs de forma eficiente. O raciocínio sequencial tradicional escala linearmente com a exploração, causando problemas de latência e do contexto rotativo. Métodos paralelos existentes, como autoconsistência, Árvore de Pensamentos ou MCTS (Monte Carlo Tree Search), impõem estruturas paralelas fixas, desperdiçando computação em problemas simples. O APR, pioneiro de Pan et al. (2025), treina modelos via RL (aprendizado por reforço) para gerar tokens especiais que controlam quando raciocinar em paralelo ou sequencialmente. O ThreadWeaver (Lian et al., 2025) é um método de APR. A execução da inferência usa um design fork-join, com abordagens como Multiverse modificando o motor de inferência para reutilizar o cache KV durante a síntese, enquanto outros, como métodos baseados em decodificação de ramificação, evitam modificações no motor. Principais benefícios: ausência de heurísticas específicas de domínio, redução de redundância e paralelismo adaptativo por complexidade da tarefa.
Fonte: BAIR (Berkeley AI) —
original
