Razonamiento Paralelo Adaptativo: Un Nuevo Paradigma para el Escalamiento Eficiente de la Inferencia de IA
Berkeley Artificial Intelligence Research
Investigadores de BAIR analizan el cambio de estrategias paralelas fijas al razonamiento paralelo adaptativo (APR), donde el propio modelo decide cuándo y cómo paralelizar subtareas. APR reduce la redundancia y latencia inherentes al razonamiento secuencial y no requiere la especificación manual de la estructura de paralelismo.
El laboratorio BAIR (Berkeley AI Research) presentó un panorama del nuevo enfoque de razonamiento paralelo adaptativo (APR, por sus siglas en inglés), que permite a los modelos de IA decidir por sí mismos cuándo dividir una tarea en subtareas paralelas, cuántos hilos ejecutar y cómo coordinarlos. Los métodos tradicionales, como self-consistency (autocoherencia) o best-of-N (el mejor de N), usan una estructura fija de paralelismo, lo que genera cómputos redundantes. Otros enfoques, como Tree-of-Thoughts (árbol de pensamientos) o Monte-Carlo Tree Search (búsqueda en árbol de Monte Carlo, MCTS), requieren heurísticas predefinidas para la descomposición. APR generaliza la idea: el modelo aprende mediante refuerzo a generar tokens de control especiales que determinan cuándo razonar de forma secuencial y cuándo en paralelo. Esto permite adaptar dinámicamente el nivel de paralelismo a la complejidad de la tarea, evitando redundancias en preguntas simples y asegurando una descomposición correcta en las complejas. Para ejecutar las ramas paralelas se utiliza una arquitectura fork-join: el modelo genera subtareas que se procesan en paralelo y luego se combinan los resultados. Para gestionar eficientemente la caché KV (caché de claves y valores) se aplican modificaciones en el motor de inferencia, como Multiverse, Parallel-R1 y NPR, que copian y fusionan la caché KV de hilos independientes en una única secuencia. Sin embargo, esto requiere cambios en el motor y puede provocar inestabilidad. Un enfoque alternativo es el uso de renderizadores universales que evitan la modificación del motor. En general, APR se considera un nuevo paradigma que permite escalar el tiempo de razonamiento sin un aumento lineal de la latencia ni pérdida de calidad debido a la 'podredumbre de contexto'.
Fuente: BAIR (Berkeley AI) —
original
