NVIDIA NeMo AutoModel nopeuttaa MoE-hienosäätöä 3,7-kertaisesti asiantuntijarinnakkaisuuden ja DeepEP:n avulla

NVIDIANVIDIA Hugging FaceHugging Face Moonshot AIMoonshot AI DeepSeekDeepSeek
NVIDIA on julkaissut NeMo AutoModel -nimisen avoimen kirjaston, joka perustuu Hugging Face Transformers v5:een ja tarjoaa 3,4–3,7 kertaa korkeamman harjoitustehokkuuden ja 29–32 % vähemmän GPU-muistia MoE-malleille asiantuntijarinnakkaisuuden, DeepEP-yhdistetyn all-to-all-välityksen ja TransformerEngine-ytimien avulla – käyttäen samaa from_pretrained()-rajapintaa pelkällä tuontimuutoksella.
NVIDIA NeMo AutoModel on avoin kirjasto NVIDIA NeMo -kehyksessä räätälöityjen generatiivisten tekoälymallien rakentamiseen suuressa mittakaavassa. Se perustuu Transformers v5:een ja lisää Expert Parallelism -rinnakkaisuuden (EP), DeepEP:n sulautetut all-to-all -välitykset ja TransformerEngine-ytimet, saavuttaen 3,4–3,7 kertaa korkeamman harjoitustehon ja 29–32 prosenttia vähemmän GPU-muistia MoE-mallien hienosäädössä verrattuna alkuperäiseen Transformers v5:een käyttäen samaa from_pretrained()-rajapintaa yhden tuontirivin muutoksella. NeMoAutoModelForCausalLM on AutoModelForCausalLM:n aliluokka, mikä mahdollistaa rajapintayhteensopivuuden Hugging Face Transformers -kirjaston kanssa. Suorituskykyparannukset tulevat Expert Parallelismista, joka vähentää muistikuormitusta jakamalla asiantuntijapainot GPU:iden kesken, DeepEP:stä, joka sulauttaa viestinnän ja laskennan, sekä TransformerEngine-ytimistä, jotka nopeuttavat ydinoperaatioita. Testituloksiin sisältyy NVIDIA Nemotron 3 Ultra 550B A55B:n täysi hienosäätö 16 solmussa (128 GPU:ta) EP=64-asetuksella, saavuttaen 815 TPS/GPU ja 58,2 GiB huippumuistia, kun Transformers v5:llä muisti loppui. Yhden solmun testeissä 8x H100 80GB:llä Qwen3-30B-A3B-mallilla saavutettiin 3,69-kertainen nopeutus (11 340 vs. 3 075 TPS/GPU) ja 29 prosentin muistivähennys (48,1 vs. 68,2 GiB), ja Nemotron 3 Nano 30B A3B -mallilla saavutettiin 3,36-kertainen nopeutus (15 421 vs. 4 583 TPS/GPU) ja 32 prosentin muistivähennys (42,5 vs. 62,1 GiB). NeMo AutoModel sisältää käsin viritettyjä toteutuksia suosituille MoE-arkkitehtuureille, kuten Qwen3, NVIDIA Nemotron, GPT-OSS ja DeepSeek V3, ja käyttää tavallista Hugging Face -toteutusta muille. Testeissä käytetään tasapainotettua reititysporttia ihanteellisen toimintapisteen emuloimiseksi. Expert Parallelism konfiguroidaan hajautetun verkon (distributed mesh) avulla, jolloin EP ja datarinnakkaisuus (data parallelism) voivat toimia samoilla laitteilla (esim. ep=8, dp=8).
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset