InvestigaciónModelos 🇨🇳 28.07.2026 16:03

Balance de carga global por lotes: casi un almuerzo gratis para mejorar el entrenamiento de LLM MoE

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen propone un método de balance de carga global por lotes para modelos de mezcla de expertos (MoE), que supera las limitaciones del balance a nivel de micro-lote sincronizando las frecuencias de selección de expertos entre todos los micro-lotes. Los experimentos muestran un mejor rendimiento y especialización de expertos en varios tamaños de modelo y configuraciones de datos.
La arquitectura de Mixture-of-Experts (MoE) es una técnica popular para escalar parámetros de modelos, pero marcos de entrenamiento existentes como Megatron-core utilizan una pérdida de equilibrio a nivel de microlote, lo que puede perjudicar el rendimiento cuando los microlotes contienen datos homogéneos (por ejemplo, solo código). Alibaba Qwen introduce una pérdida de equilibrio por lote global, que sincroniza la frecuencia de selección de expertos en todos los grupos paralelos y calcula la pérdida de manera global. Los experimentos con tres configuraciones MoE (3.4B/0.6B activados, 15B/2.54B activados, 43B/6.6B activados) y hasta 400 mil millones de tokens muestran que el equilibrio por lote global supera consistentemente al equilibrio por microlote en diversas tareas. También conduce a una especialización significativa de los expertos por dominio, que está ausente en los modelos con equilibrio por microlote. Agregar una pequeña pérdida de equilibrio por microlote (peso 0.01) además de la pérdida global mejora la velocidad de entrenamiento sin afectar la efectividad. El método es casi gratuito porque la sincronización implica solo un vector de tamaño igual al número de expertos. El trabajo se publicó en el preprint de arXiv 2501.11873.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas