InvestigaciónCódigo Abierto 🇺🇸 27.07.2026 10:04

Acelerando el ajuste fino de transformers con NVIDIA NeMo AutoModel

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA ha presentado NeMo AutoModel, una biblioteca de código abierto para la creación a gran escala de modelos de IA generativa personalizados basados en Transformers v5. Añade paralelismo de expertos (Expert Parallelism), DeepEP y kernels de TransformerEngine, logrando aceleraciones de entrenamiento de 3.4 a 3.7 veces y reduciendo el consumo de memoria de la GPU entre un 29% y un 32% al ajustar modelos MoE sin cambios en la API.
NVIDIA NeMo AutoModel es una biblioteca de código abierto que forma parte del framework NVIDIA NeMo para crear modelos de IA generativa personalizados a gran escala. Se basa en Transformers v5, añadiendo paralelismo de expertos (Expert Parallelism), DeepEP fused all-to-all dispatch y núcleos TransformerEngine, y utiliza la carga dinámica de pesos v5 para aplicar estas optimizaciones a una amplia gama de familias de modelos. El resultado es un aumento del rendimiento de entrenamiento de 3,4 a 3,7 veces y una reducción del uso de memoria de GPU del 29 al 32% al ajustar finamente modelos MoE en comparación con Transformers v5 nativo usando la misma API from_pretrained(); basta con cambiar una línea de importación sin modificar el resto del código. NeMo AutoModelForCausalLM es una subclase de AutoModelForCausalLM, por lo que cualquier código que funcione con modelos de Hugging Face también funciona con AutoModel. Para arquitecturas MoE populares (Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3), NeMo AutoModel utiliza implementaciones especializadas con atención TransformerEngine, capas lineales plegadas y núcleos de experto personalizados. Para el resto de modelos se aplica un fallback optimizado con núcleos Liger. Mediciones de rendimiento mostraron: en el ajuste fino completo del modelo Nemotron 3 Ultra 550B A55B en 16 nodos (128 GPU), NeMo AutoModel alcanzó 815 tokens/s por GPU y 293 TFLOP/s por GPU con un pico de memoria de 58,2 GB, mientras que Transformers v5 no pudo ejecutarse a esa escala por falta de memoria. En pruebas de un solo nodo con 8 GPU para Qwen3-30B-A3B, NeMo AutoModel mostró 11 340 tokens/s por GPU (frente a 3 075 de v5, una aceleración de 3,69×) y un pico de memoria de 48,1 GB (un 29% menos que los 68,2 GB de v5). Para Nemotron 3 Nano 30B A3B los resultados fueron: 15 421 tokens/s (frente a 4 583, aceleración de 3,36×) y 42,5 GB de memoria (un 32% menos que los 62,1 GB de v5). La aceleración se logra gracias a tres factores: el paralelismo de expertos reduce la presión sobre la memoria, DeepEP fusiona la comunicación con los cálculos, y los núcleos TransformerEngine aceleran las operaciones principales.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas