NVIDIA NeMo AutoModel versnelt MoE-finetuning 3,7x met Expert Parallelism en DeepEP
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA heeft NeMo AutoModel geïntroduceerd, een open bibliotheek die voortbouwt op Hugging Face Transformers v5 en 3,4 tot 3,7 keer hogere trainingsdoorvoer en 29 tot 32 procent minder GPU-geheugen levert voor MoE-modellen via Expert Parallelism, DeepEP fused all-to-all dispatch en TransformerEngine-kernels, met dezelfde from_pretrained()-API en slechts één importwijziging.
NVIDIA NeMo AutoModel is een open bibliotheek binnen het NVIDIA NeMo-framework voor het op schaal bouwen van aangepaste generatieve AI-modellen. Het bouwt voort op Transformers v5 en voegt Expert Parallelism (EP), DeepEP gefuseerde all-to-all dispatch en TransformerEngine-kernels toe. Hiermee wordt een 3,4 tot 3,7 keer hogere trainingsthroughput en 29 tot 32 procent minder GPU-geheugen bereikt bij het finetunen van MoE-modellen in vergelijking met native Transformers v5, met behulp van dezelfde from_pretrained()-API en een enkele wijziging in de importregel. NeMoAutoModelForCausalLM erf van AutoModelForCausalLM, waardoor API-compatibiliteit met Hugging Face Transformers mogelijk is. De prestatieverbeteringen komen voort uit Expert Parallelism, dat de geheugendruk vermindert door expertgewichten over GPU's te verdelen, DeepEP dat communicatie combineert met berekening, en TransformerEngine-kernels die kernbewerkingen versnellen. De benchmarks omvatten het volledig finetunen van NVIDIA Nemotron 3 Ultra 550B A55B over 16 nodes (128 GPU's) met EP=64, wat resulteerde in 815 TPS/GPU en 58,2 GiB piekgeheugen, terwijl Transformers v5 geen geheugen meer had. Single-node benchmarks op 8x H100 80 GB voor Qwen3-30B-A3B toonden een 3,69x versnelling (11.340 versus 3.075 TPS/GPU) en 29 procent geheugenreductie (48,1 versus 68,2 GiB), en voor Nemotron 3 Nano 30B A3B een 3,36x versnelling (15.421 versus 4.583 TPS/GPU) en 32 procent geheugenreductie (42,5 versus 62,1 GiB). NeMo AutoModel levert handmatig afgestemde implementaties voor populaire MoE-architecturen zoals Qwen3, NVIDIA Nemotron, GPT-OSS en DeepSeek V3, en valt terug op vanilla HF voor andere. Het gebruikt een gebalanceerde routeringsgate voor benchmarks om een ideaal werkpunt te simuleren. Expert Parallelism wordt geconfigureerd via een gedistribueerd mesh, waardoor EP en dataparallellisme op dezelfde apparaten kunnen worden gecombineerd (bijvoorbeeld ep=8, dp=8).
Bron: Hugging Face blog —
origineel
