NVIDIA NeMo AutoModel:借助专家并行与DeepEP技术,将MoE微调速度提升3.7倍
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA 推出了 NeMo AutoModel,这是一个基于 Hugging Face Transformers v5 构建的开放库,通过专家并行(Expert Parallelism)、DeepEP 融合的全对全分发(all-to-all dispatch)以及 TransformerEngine 内核,使得混合专家(MoE)模型的训练吞吐量提升 3.4 到 3.7 倍,GPU 内存减少 29% 至 32%。用户只需更改 import 语句,即可使用相同的 from_pretrained() API。
NVIDIA NeMo AutoModel 是 NVIDIA NeMo 框架内的一个开源库,用于大规模构建自定义生成式 AI 模型。它基于 Transformers v5,增加了专家并行(Expert Parallelism,EP)、DeepEP 融合全到全通信(all-to-all dispatch)以及 TransformerEngine 内核,在微调 MoE 模型时,相比原生 Transformers v5,训练吞吐量提升 3.4 至 3.7 倍,GPU 内存减少 29% 至 32%,且只需更改一行导入代码即可使用相同的 from_pretrained() API。NeMoAutoModelForCausalLM 是 AutoModelForCausalLM 的子类,确保与 Hugging Face Transformers 的 API 兼容。性能提升源自专家并行通过将专家权重分布到多个 GPU 上来降低内存压力,DeepEP 将通信与计算融合,以及 TransformerEngine 内核加速核心运算。基准测试包括在 16 个节点(128 块 GPU)上对 NVIDIA Nemotron 3 Ultra 550B A55B 进行全参数微调,采用 EP=64 时达到 815 TPS/GPU 和 58.2 GiB 峰值内存,而 Transformers v5 则出现内存不足。在 8×H100 80GB 的单节点基准测试中,Qwen3-30B-A3B 实现了 3.69 倍加速(11,340 对比 3,075 TPS/GPU)和 29% 内存减少(48.1 对比 68.2 GiB),Nemotron 3 Nano 30B A3B 实现了 3.36 倍加速(15,421 对比 4,583 TPS/GPU)和 32% 内存减少(42.5 对比 62.1 GiB)。NeMo AutoModel 为流行的 MoE 架构(如 Qwen3、NVIDIA Nemotron、GPT-OSS 和 DeepSeek V3)提供了手动调优的实现,对于其他架构则回退到标准 Hugging Face Transformers。基准测试中使用了均衡路由门(balanced routing gate)来模拟理想运行点。专家并行通过分布式网格进行配置,使得专家并行和数据并行可以在同一设备上组合使用(例如 ep=8, dp=8)。
来源: Hugging Face blog —
原文
