Open SourceAffaires et Marché 🇺🇸 27.07.2026 10:04

NVIDIA NeMo AutoModel accélère le fine-tuning des MoE de 3,7x grâce au parallélisme expert et à DeepEP

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA a présenté NeMo AutoModel, une bibliothèque ouverte construite sur Hugging Face Transformers v5, offrant un débit d'entraînement 3,4 à 3,7 fois supérieur et une consommation de mémoire GPU réduite de 29 % à 32 % pour les modèles MoE, grâce au parallélisme expert (Expert Parallelism), au dispatch fusionné de type all-to-all de DeepEP et aux noyaux TransformerEngine, le tout en utilisant la même API from_pretrained() avec un simple changement d'import.
NVIDIA NeMo AutoModel est une bibliothèque open source au sein du framework NVIDIA NeMo, conçue pour construire des modèles d'IA générative personnalisés à grande échelle. Elle s'appuie sur Transformers v5, en y ajoutant le parallélisme d'experts (Expert Parallelism, EP), la distribution fusionnée de type «all-to-all» de DeepEP, et les noyaux TransformerEngine, ce qui permet d'obtenir un débit d'apprentissage 3,4 à 3,7 fois supérieur et une consommation mémoire GPU réduite de 29 à 32 % lors du fine-tuning de modèles MoE par rapport à Transformers v5 natif, en utilisant la même API from_pretrained() avec un simple changement de ligne d'importation. NeMoAutoModelForCausalLM sous-classe AutoModelForCausalLM, garantissant ainsi une compatibilité d'API avec Hugging Face Transformers. Les gains de performance proviennent du parallélisme d'experts, qui réduit la pression mémoire en répartissant les poids des experts sur plusieurs GPU, de DeepEP qui fusionne la communication et le calcul, et des noyaux TransformerEngine qui accélèrent les opérations de base. Les benchmarks incluent le fine-tuning complet de NVIDIA Nemotron 3 Ultra 550B A55B sur 16 nœuds (128 GPU) avec EP=64, atteignant 815 TPS/GPU et une mémoire maximale de 58,2 Gio, tandis que Transformers v5 manquait de mémoire. Les benchmarks sur un seul nœud avec 8x H100 80 Go pour Qwen3-30B-A3B ont montré une accélération de 3,69 fois (11 340 contre 3 075 TPS/GPU) et une réduction mémoire de 29 % (48,1 contre 68,2 Gio), et pour Nemotron 3 Nano 30B A3B, une accélération de 3,36 fois (15 421 contre 4 583 TPS/GPU) et une réduction mémoire de 32 % (42,5 contre 62,1 Gio). NeMo AutoModel propose des implémentations optimisées pour les architectures MoE populaires telles que Qwen3, NVIDIA Nemotron, GPT-OSS et DeepSeek V3, et utilise une implémentation vanilla de Hugging Face pour les autres. Il utilise un mécanisme de routage équilibré pour les benchmarks afin d'atteindre un point de fonctionnement idéal. Le parallélisme d'experts se configure via un maillage distribué, permettant de combiner le parallélisme d'experts et le parallélisme des données sur les mêmes périphériques (par exemple, ep=8, dp=8).
Source: Hugging Face blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches