NVIDIA NeMo AutoModel, Uzman Paralelliği ve DeepEP ile MoE İnce Ayarını 3,7 Kat Hızlandırıyor
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA, Hugging Face Transformers v5 üzerine inşa edilmiş açık kaynaklı bir kütüphane olan NeMo AutoModel'i tanıttı. Bu kütüphane, Uzman Paralelliği, DeepEP birleştirilmiş herkese dağıtım ve TransformerEngine çekirdekleri sayesinde MoE modellerinde 3,4-3,7 kat daha yüksek eğitim verimi ve %29-32 daha az GPU belleği sunuyor; yalnızca bir import değişikliği ile aynı from_pretrained() API'sini kullanıyor.
NVIDIA NeMo AutoModel, NVIDIA NeMo çerçevesi içinde ölçekte özel üretken yapay zeka modelleri oluşturmak için açık bir kütüphanedir. Transformers v5 üzerine inşa edilerek, Uzman Paralelliği (Expert Parallelism, EP), DeepEP birebir tümleşik dağıtım (fused all-to-all dispatch) ve TransformerEngine çekirdekleri ekler. Aynı from_pretrained() API'si ve tek bir import satırı değişikliği ile, MoE modellerinin ince ayarında native Transformers v5'e kıyasla 3,4-3,7 kat daha yüksek eğitim verimi ve %29-32 daha az GPU belleği sağlar. NeMoAutoModelForCausalLM, AutoModelForCausalLM'den türetilerek Hugging Face Transformers ile API uyumluluğu sunar. Performans kazanımları, uzman ağırlıklarını GPU'lar arasında dağıtarak bellek baskısını azaltan Uzman Paralelliği, iletişimi hesaplamayla birleştiren DeepEP ve temel işlemleri hızlandıran TransformerEngine çekirdeklerinden gelir. Karşılaştırmalar, 16 düğüm (128 GPU) üzerinde EP=64 ile NVIDIA Nemotron 3 Ultra 550B A55B modelinin tam ince ayarında 815 TPS/GPU ve 58,2 GiB tepe bellek kullanımı elde edilirken, Transformers v5'in bellek yetersizliği nedeniyle çalışamadığını gösterir. 8x H100 80GB ile yapılan tek düğüm karşılaştırmalarında, Qwen3-30B-A3B için 3,69 kat hızlanma (11.340'a karşı 3.075 TPS/GPU) ve %29 bellek azalması (48,1'e karşı 68,2 GiB); Nemotron 3 Nano 30B A3B için ise 3,36 kat hızlanma (15.421'e karşı 4.583 TPS/GPU) ve %32 bellek azalması (42,5'e karşı 62,1 GiB) gözlemlenmiştir. NeMo AutoModel, Qwen3, NVIDIA Nemotron, GPT-OSS ve DeepSeek V3 gibi popüler MoE mimarileri için elle ayarlanmış uygulamalar sunar; diğerleri için standart Hugging Face uygulamasına geri döner. Karşılaştırmalarda ideal çalışma noktasını simüle etmek için dengeli yönlendirme kapısı (balanced routing gate) kullanılır. Uzman Paralelliği, dağıtılmış ağ (distributed mesh) aracılığıyla yapılandırılır ve aynı cihazlarda EP ile veri paralelliğinin bir arada kullanılmasına olanak tanır (örneğin, ep=8, dp=8).
Kaynak: Hugging Face blog —
orijinal
