NVIDIA NeMo AutoModel acelera o fine-tuning de MoE em 3,7x com paralelismo de especialistas e DeepEP
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
A NVIDIA apresentou o NeMo AutoModel, uma biblioteca aberta que se baseia no Hugging Face Transformers v5, oferecendo de 3,4 a 3,7 vezes mais rendimento de treinamento e de 29 a 32 por cento menos memória da GPU para modelos MoE, por meio de paralelismo de especialistas, despacho all-to-all fundido do DeepEP e kernels do TransformerEngine — usando a mesma API from_pretrained() com apenas uma mudança de importação.
NVIDIA NeMo AutoModel é uma biblioteca de código aberto dentro do framework NVIDIA NeMo para construir modelos generativos de IA personalizados em escala. Ela é construída sobre o Transformers v5, adicionando Paralelismo de Especialistas (Expert Parallelism, EP), dispatch all-to-all fundido do DeepEP e kernels do TransformerEngine, alcançando um throughput de treinamento de 3,4 a 3,7 vezes maior e 29% a 32% menos memória de GPU durante o ajuste fino de modelos de Mistura de Especialistas (Mixture of Experts, MoE) em comparação com o Transformers v5 nativo, usando a mesma API from_pretrained() com apenas uma alteração de linha de importação. O NeMoAutoModelForCausalLM é uma subclasse do AutoModelForCausalLM, garantindo compatibilidade de API com o Hugging Face Transformers. Os ganhos de desempenho vêm do Paralelismo de Especialistas, que reduz a pressão de memória distribuindo os pesos dos especialistas entre as GPUs, do DeepEP, que funde comunicação com computação, e dos kernels do TransformerEngine, que aceleram operações principais. Os benchmarks incluem o ajuste fino completo do NVIDIA Nemotron 3 Ultra 550B A55B em 16 nós (128 GPUs) com EP=64, atingindo 815 tokens por segundo (TPS) por GPU e pico de memória de 58,2 GiB, enquanto o Transformers v5 ficou sem memória. Benchmarks de nó único em 8x H100 80GB para Qwen3-30B-A3B mostraram um speedup de 3,69 vezes (11.340 contra 3.075 TPS/GPU) e redução de 29% na memória (48,1 contra 68,2 GiB), e para Nemotron 3 Nano 30B A3B mostraram um speedup de 3,36 vezes (15.421 contra 4.583 TPS/GPU) e redução de 32% na memória (42,5 contra 62,1 GiB). O NeMo AutoModel oferece implementações ajustadas manualmente para arquiteturas MoE populares como Qwen3, NVIDIA Nemotron, GPT-OSS e DeepSeek V3, recorrendo ao vanilla Hugging Face (HF) para outras. Ele usa uma porta de roteamento balanceada para os benchmarks, a fim de emular o ponto operacional ideal. O Paralelismo de Especialistas é configurado por meio de uma malha distribuída, permitindo que o EP e o paralelismo de dados componham-se nos mesmos dispositivos (por exemplo, ep=8, dp=8).
Fonte: Hugging Face blog —
original
