NVIDIA NeMo AutoModel acelera el ajuste fino de MoE 3.7x con paralelismo de expertos y DeepEP
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA ha presentado NeMo AutoModel, una biblioteca abierta que se basa en Hugging Face Transformers v5, ofreciendo un rendimiento de entrenamiento 3.4-3.7x superior y un 29-32% menos de memoria de GPU para modelos MoE mediante paralelismo de expertos, el envío fusionado all-to-all de DeepEP y kernels de TransformerEngine, utilizando la misma API from_pretrained() con solo un cambio de importación.
NVIDIA NeMo AutoModel es una biblioteca abierta dentro del marco de trabajo NVIDIA NeMo para construir modelos de IA generativa personalizados a gran escala. Se basa en Transformers v5, añadiendo Parallelismo de Expertos (EP, por sus siglas en inglés), el envío fusionado de todos a todos (all-to-all) de DeepEP y kernels de TransformerEngine, logrando un rendimiento de entrenamiento de 3,4 a 3,7 veces mayor y un 29-32 % menos de memoria de GPU en el ajuste fino de modelos MoE en comparación con Transformers v5 nativo, utilizando la misma API from_pretrained() con un solo cambio de línea de importación. NeMoAutoModelForCausalLM subclasea AutoModelForCausalLM, lo que permite compatibilidad de API con Hugging Face Transformers. Las ganancias de rendimiento provienen del Parallelismo de Expertos, que reduce la presión de memoria al distribuir los pesos de los expertos entre las GPU; de la fusión de comunicación con cómputo de DeepEP; y de los kernels de TransformerEngine, que aceleran las operaciones principales. Los puntos de referencia incluyen el ajuste fino completo de NVIDIA Nemotron 3 Ultra 550B A55B en 16 nodos (128 GPU) con EP=64, logrando 815 TPS/GPU y 58,2 GiB de memoria máxima, mientras que Transformers v5 se quedó sin memoria. En puntos de referencia de un solo nodo en 8x H100 80GB para Qwen3-30B-A3B se mostró una aceleración de 3,69 veces (11 340 frente a 3 075 TPS/GPU) y una reducción de memoria del 29 % (48,1 frente a 68,2 GiB), y para Nemotron 3 Nano 30B A3B se mostró una aceleración de 3,36 veces (15 421 frente a 4 583 TPS/GPU) y una reducción de memoria del 32 % (42,5 frente a 62,1 GiB). NeMo AutoModel incluye implementaciones ajustadas manualmente para arquitecturas MoE populares como Qwen3, NVIDIA Nemotron, GPT-OSS y DeepSeek V3, recurriendo a HF estándar para otras. Utiliza una puerta de enrutamiento balanceada para los puntos de referencia a fin de emular el punto de operación ideal. El Parallelismo de Expertos se configura a través de una malla distribuida, lo que permite que EP y el paralelismo de datos se compongan en los mismos dispositivos (por ejemplo, ep=8, dp=8).
Fuente: Hugging Face blog —
original
