研究开源 🇺🇸 27.07.2026 10:04

使用NVIDIA NeMo AutoModel加速Transformer微调

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA推出了NeMo AutoModel,这是一个开源库,用于基于Transformer v5大规模创建自定义生成式AI模型。它添加了Expert Parallelism、DeepEP和TransformerEngine内核,在无需更改API的情况下,微调MoE模型时实现了3.4至3.7倍的训练加速,并减少了29%至32%的GPU内存消耗。
NVIDIA NeMo AutoModel 是一个开源库,作为 NVIDIA NeMo 框架的一部分,用于大规模构建自定义生成式 AI 模型。它构建在 Transformers v5 之上,增加了专家并行(Expert Parallelism)、DeepEP 融合全到全调度(fused all-to-all dispatch)以及 TransformerEngine 核心,并利用动态权重加载 v5(dynamic weight loading v5)将这些优化应用于广泛模型家族。结果:与使用相同 from_pretrained() API 的原生 Transformers v5 相比,在微调 MoE 模型时,训练吞吐量提升了 3.4 到 3.7 倍,GPU 内存使用量降低了 29% 到 32%——只需更改一行导入代码,无需改动其余部分。NeMoAutoModelForCausalLM 是 AutoModelForCausalLM 的子类,因此任何适用于 Hugging Face 模型的代码也同样适用于 AutoModel。对于流行的 MoE 架构(如 Qwen3、NVIDIA Nemotron、GPT-OSS、DeepSeek V3),NeMo AutoModel 使用了专门的实现,包含 TransformerEngine 注意力、融合线性层(fused linear layers)和自定义专家核心。对于其他模型,则采用基于 Liger 核心的优化回退方案。性能测试显示:在 16 个节点(128 个 GPU)上对 Nemotron 3 Ultra 550B A55B 模型进行全参数微调时,NeMo AutoModel 达到了每个 GPU 815 个 token/秒和 293 TFLOP/s,峰值内存为 58.2 GB,而 Transformers v5 由于内存不足无法在此规模下运行。在单节点 8 个 GPU 的测试中,对于 Qwen3-30B-A3B,NeMo AutoModel 达到了每个 GPU 11340 个 token/秒(v5 为 3075,加速比 3.69 倍),峰值内存为 48.1 GB(比 v5 的 68.2 GB 减少 29%)。对于 Nemotron 3 Nano 30B A3B,结果为:每个 GPU 15421 个 token/秒(v5 为 4583,加速比 3.36 倍),内存 42.5 GB(比 v5 的 62.1 GB 减少 32%)。加速得益于三个因素:专家并行降低了内存压力,DeepEP 融合了通信与计算,以及 TransformerEngine 核心加速了关键操作。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻