OnderzoekOpen Source 🇺🇸 27.07.2026 10:04

Versnel fijnafstemming van Transformers met NVIDIA NeMo AutoModel

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA heeft NeMo AutoModel geïntroduceerd, een open-source bibliotheek voor het op grote schaal creëren van aangepaste generatieve AI-modellen op basis van Transformers v5. Het voegt Expert Parallelism, DeepEP en TransformerEngine kernels toe, wat leidt tot trainingsversnellingen van 3,4–3,7x en een vermindering van het GPU-geheugengebruik met 29–32% bij het fijnafstemmen van MoE-modellen, zonder API-wijzigingen.
NVIDIA NeMo AutoModel is een open-sourcebibliotheek, onderdeel van het NVIDIA NeMo-framework, voor het op schaal bouwen van aangepaste generatieve AI-modellen. Het bouwt voort op Transformers v5 en voegt Expert Parallelism, DeepEP fused all-to-all dispatch en TransformerEngine-kernels toe, en maakt gebruik van dynamisch gewichten laden in v5 om deze optimalisaties toe te passen op een breed scala aan modelfamilies. Het resultaat is een 3,4 tot 3,7 keer hogere trainingsdoorvoer en 29% tot 32% minder GPU-geheugengebruik bij het finetunen van MoE-modellen vergeleken met native Transformers v5 met dezelfde from_pretrained()-API – het volstaat om één importregel te wijzigen zonder de rest van de code aan te passen. NeMoAutoModelForCausalLM is een subklasse van AutoModelForCausalLM, dus alle code die werkt met HF-modellen werkt ook met AutoModel. Voor populaire MoE-architecturen (Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3) gebruikt NeMo AutoModel speciale implementaties met TransformerEngine-attentie, samengevoegde lineaire lagen en aangepaste expertkernels. Voor andere modellen wordt een geoptimaliseerde fallback met Liger-kernels toegepast. Prestatiemetingen tonen: bij volledig finetunen van het Nemotron 3 Ultra 550B A55B-model op 16 nodes (128 GPU's) haalde NeMo AutoModel 815 tokens per seconde per GPU en 293 TFLOP per seconde per GPU, met een piekgeheugengebruik van 58,2 GB, terwijl Transformers v5 niet kon worden gestart op deze schaal vanwege geheugenproblemen. Bij tests op één node met 8 GPU's voor Qwen3-30B-A3B behaalde NeMo AutoModel 11.340 tokens per seconde per GPU (tegenover 3.075 voor v5, een versnelling van 3,69 keer) en een piekgeheugen van 48,1 GB (29% minder dan 68,2 GB voor v5). Voor Nemotron 3 Nano 30B A3B waren de resultaten: 15.421 tokens per seconde (tegenover 4.583, een versnelling van 3,36 keer) en 42,5 GB geheugen (32% minder dan 62,1 GB voor v5). De versnelling wordt bereikt door drie factoren: Expert Parallelism vermindert de geheugendruk, DeepEP combineert communicatie met berekeningen en TransformerEngine-kernels versnellen kernoperaties.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws