PesquisaModelos 🇺🇸 27.07.2026 14:04

Raciocínio Paralelo Adaptativo: Um Novo Paradigma para o Escalonamento Eficiente da Inferência de IA

Berkeley Artificial Intelligence ResearchBerkeley Artificial Intelligence Research
Pesquisadores do BAIR analisam a transição de estratégias paralelas fixas para o raciocínio paralelo adaptativo (APR), onde o próprio modelo decide quando e como paralelizar subtarefas. O APR reduz a redundância e a latência inerentes ao raciocínio sequencial e não requer a especificação manual da estrutura de paralelismo.
O laboratório BAIR (Berkeley AI Research) apresentou uma visão geral de uma nova abordagem — o raciocínio paralelo adaptativo (APR, do inglês Adaptive Parallel Reasoning) —, que permite que modelos de IA decidam por conta própria quando dividir uma tarefa em subtarefas paralelas, quantos threads executar e como coordená-los. Métodos tradicionais, como self-consistency (autoconsistência) ou best-of-N (melhor de N), usam uma estrutura de paralelismo fixa, o que leva a computação redundante. Outras abordagens, como Tree-of-Thoughts (árvore de pensamentos) ou Monte-Carlo Tree Search (busca em árvore de Monte Carlo, MCTS), exigem heurísticas pré-definidas para decomposição. O APR generaliza a ideia: o modelo é treinado com reforço para gerar tokens de controle especiais que determinam quando raciocinar sequencialmente ou em paralelo. Isso permite adaptar dinamicamente o nível de paralelismo de acordo com a complexidade da tarefa, evitando redundância em questões simples e garantindo a decomposição correta em questões complexas. Para executar ramificações paralelas, é usada uma arquitetura fork-join: o modelo gera subtarefas, que são processadas em paralelo, e depois os resultados são combinados. Para um gerenciamento eficiente do cache KV (cache de chaves-valores), são aplicadas modificações no motor de inferência, como Multiverse, Parallel-R1 e NPR, que copiam e concatenam o cache KV de fluxos independentes em uma única sequência. No entanto, isso exige alterações no motor e pode levar a instabilidade. Uma abordagem alternativa é o uso de renderizadores universais, que dispensam a modificação do motor. No geral, o APR é visto como um novo paradigma, permitindo escalar o tempo de raciocínio sem aumento linear de latência ou perda de qualidade devido à "degradação do contexto".
Fonte: BAIR (Berkeley AI) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas