NVIDIA NeMo AutoModel, 전문가 병렬 처리와 DeepEP로 MoE 미세 조정 3.7배 가속
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA가 Hugging Face Transformers v5를 기반으로 하는 오픈 라이브러리 NeMo AutoModel을 출시했습니다. 전문가 병렬 처리(Expert Parallelism), DeepEP 융합 올-투-올 디스패치, TransformerEngine 커널을 통해 MoE 모델의 학습 처리량을 3.4~3.7배 높이고 GPU 메모리를 29~32% 절감합니다. 기존 from_pretrained() API를 그대로 사용하며 import 변경만으로 적용 가능합니다.
NVIDIA NeMo AutoModel은 NVIDIA NeMo 프레임워크 내에서 사용자 정의 생성형 AI 모델을 대규모로 구축하기 위한 오픈 라이브러리입니다. 이 라이브러리는 Transformers v5를 기반으로 하여 Expert Parallelism, DeepEP 융합 올투올 디스패치(DeepEP fused all-to-all dispatch), 그리고 TransformerEngine 커널을 추가하여, 기본 Transformers v5와 동일한 from_pretrained() API와 단일 임포트 라인 변경만으로도 MoE 모델 미세 조정 시 학습 처리량이 3.4~3.7배 높아지고 GPU 메모리 사용량이 29~32% 감소합니다. NeMoAutoModelForCausalLM은 AutoModelForCausalLM을 서브클래싱하여 Hugging Face Transformers와의 API 호환성을 제공합니다. 성능 향상은 Expert Parallelism이 전문가 가중치를 여러 GPU에 분산시켜 메모리 부담을 줄이고, DeepEP가 통신과 계산을 융합하며, TransformerEngine 커널이 핵심 연산을 가속화함으로써 이루어집니다. 벤치마크에는 16개 노드(128개 GPU)에서 NVIDIA Nemotron 3 Ultra 550B A55B를 전체 미세 조정한 결과가 포함되며, EP=64에서 GPU당 초당 815 토큰(TPS)과 58.2 GiB 피크 메모리를 달성한 반면, Transformers v5는 메모리 부족으로 실행되지 못했습니다. 8x H100 80GB에서의 단일 노드 벤치마크는 Qwen3-30B-A3B에서 3.69배 속도 향상(GPU당 초당 11,340 대 3,075 토큰)과 29% 메모리 감소(48.1 대 68.2 GiB)를 보였고, Nemotron 3 Nano 30B A3B에서는 3.36배 속도 향상(GPU당 초당 15,421 대 4,583 토큰)과 32% 메모리 감소(42.5 대 62.1 GiB)를 보였습니다. NeMo AutoModel은 Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3와 같은 인기 있는 MoE 아키텍처에 대해 수동으로 조정된 구현을 제공하며, 다른 아키텍처의 경우 기본 Hugging Face 구현으로 대체됩니다. 벤치마크에서는 균형 라우팅 게이트를 사용하여 이상적인 동작 지점을 에뮬레이션합니다. Expert Parallelism은 분산 메시(distributed mesh)를 통해 구성되며, 동일한 장치에서 EP와 데이터 병렬 처리가 함께 사용될 수 있습니다(예: ep=8, dp=8).
출처: Hugging Face blog —
원문
