Adaptive Parallel Reasoning: A New Paradigm for Efficient Scaling of AI Inference
Berkeley Artificial Intelligence Research
Researchers at BAIR analyze the shift from fixed parallel strategies to adaptive parallel reasoning (APR), where the model itself decides when and how to parallelize subtasks. APR reduces the redundancy and latency inherent in sequential reasoning and does not require manual specification of the parallelism structure.
BAIR (Berkeley AI Research) laboratuvarı, yapay zeka modellerinin bir görevi ne zaman paralel alt görevlere böleceğine, kaç iş parçacığı çalıştıracağına ve bunları nasıl koordine edeceğine kendi başına karar vermesini sağlayan yeni bir yaklaşım olan uyarlanabilir paralel akıl yürütmenin (APR) bir incelemesini sundu. Self-consistency (kendi kendine tutarlılık) veya best-of-N (en iyi N) gibi geleneksel yöntemler sabit bir paralellik yapısı kullanır ve bu da gereksiz hesaplamalara yol açar. Tree-of-Thoughts (düşünce ağacı) veya Monte-Carlo Tree Search (MCTS) gibi diğer yaklaşımlar, ayrıştırma için önceden tanımlanmış sezgisel yöntemler gerektirir. APR bu fikri genelleştirir: model, ne zaman sıralı, ne zaman paralel akıl yürüteceğini belirleyen özel kontrol tokenleri üretmek için pekiştirmeli öğrenme ile eğitilir. Bu, paralellik seviyesinin görevin karmaşıklığına göre dinamik olarak uyarlanmasına, basit sorularda gereksizliğin önlenmesine ve karmaşık sorularda doğru ayrıştırmanın sağlanmasına olanak tanır. Paralel dalları yürütmek için fork-join (çatalla birleştir) mimarisi kullanılır: model, paralel olarak işlenen alt görevler oluşturur ve ardından sonuçlar birleştirilir. KV cache'in (anahtar-değer önbelleği) verimli yönetimi için Multiverse, Parallel-R1 ve NPR gibi bağımsız iş parçacıklarından KV cache'i kopyalayıp tek bir diziye birleştiren çıkarım motoru değişiklikleri uygulanır. Ancak bu, motorda değişiklik gerektirir ve istikrarsızlığa yol açabilir. Alternatif bir yaklaşım, motor değişikliği gerektirmeyen evrensel oluşturucuların kullanılmasıdır. Genel olarak APR, gecikmede doğrusal bir artış olmadan ve 'bağlam çürümesi' nedeniyle kalite kaybı yaşanmadan akıl yürütme süresinin ölçeklendirilmesine olanak tanıyan yeni bir paradigma olarak değerlendirilmektedir.
Kaynak: BAIR (Berkeley AI) —
orijinal
