Accélérer le fine-tuning des Transformers avec NVIDIA NeMo AutoModel
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA a introduit NeMo AutoModel, une bibliothèque open-source pour la création à grande échelle de modèles d'IA générative personnalisés basés sur Transformers v5. Elle ajoute Expert Parallelism, DeepEP et les noyaux TransformerEngine, permettant des accélérations d'entraînement de 3,4 à 3,7 fois et une réduction de la consommation mémoire GPU de 29 à 32 % lors du fine-tuning de modèles MoE sans changement d'API.
NVIDIA NeMo AutoModel est une bibliothèque open source intégrée au framework NVIDIA NeMo, conçue pour créer des modèles d'IA génératifs personnalisés à grande échelle. Elle repose sur Transformers v5, en y ajoutant le parallélisme expert (Expert Parallelism), le dispatch fusionné all-to-all de DeepEP et les noyaux TransformerEngine, tout en utilisant le chargement dynamique des poids de la v5 pour appliquer ces optimisations à un large éventail de familles de modèles. Résultat : un débit d'entraînement multiplié par 3,4 à 3,7 et une réduction de l'utilisation de la mémoire GPU de 29 à 32 % lors du fine-tuning de modèles MoE par rapport à Transformers v5 natif avec la même API from_pretrained() — il suffit de changer une ligne d'import sans toucher au reste du code. NeMoAutoModelForCausalLM est une sous-classe d'AutoModelForCausalLM, donc tout code fonctionnant avec les modèles Hugging Face fonctionne également avec AutoModel. Pour les architectures MoE populaires (Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3), NeMo AutoModel utilise des implémentations spéciales avec attention TransformerEngine, couches linéaires repliées et noyaux experts personnalisés. Pour les autres modèles, un fallback optimisé avec les noyaux Liger est appliqué. Les mesures de performance montrent que, lors du fine-tuning complet du modèle Nemotron 3 Ultra 550B A55B sur 16 nœuds (128 GPU), NeMo AutoModel a atteint 815 tokens/s par GPU et 293 TFLOP/s par GPU, avec un pic de mémoire de 58,2 Go, tandis que Transformers v5 n'a pas pu démarrer à cette échelle par manque de mémoire. Sur des tests à un nœud avec 8 GPU pour Qwen3-30B-A3B, NeMo AutoModel a affiché 11 340 tokens/s par GPU (contre 3 075 pour v5, soit un gain de 3,69×) et un pic mémoire de 48,1 Go (29 % de moins que les 68,2 Go de v5). Pour Nemotron 3 Nano 30B A3B, les résultats sont : 15 421 tokens/s (contre 4 583, gain de 3,36×) et 42,5 Go de mémoire (32 % de moins que les 62,1 Go de v5). L'accélération provient de trois facteurs : le parallélisme expert réduit la pression mémoire, DeepEP fusionne communication et calcul, et les noyaux TransformerEngine accélèrent les opérations clés.
Source: Hugging Face blog —
original
