NVIDIA NeMo AutoModel nopeuttaa Transformer-mallien hienosäätöä
NVIDIA
Hugging Face
Moonshot AI
DeepSeek
NVIDIA on julkaissut NeMo AutoModel -nimisen avoimen lähdekoodin kirjaston, joka mahdollistaa räätälöityjen generatiivisten tekoälymallien luomisen suuressa mittakaavassa Transformer v5 -arkkitehtuurin pohjalta. Se lisää Expert Parallelism-, DeepEP- ja TransformerEngine-ydintoiminnot, saavuttaen 3,4–3,7 kertaiset harjoitusnopeutukset ja vähentäen GPU-muistin kulutusta 29–32 prosenttia MoE-mallien hienosäädössä ilman API-muutoksia.
NVIDIA NeMo AutoModel on avoimen lähdekoodin kirjasto, joka kuuluu NVIDIA NeMo -viitekehykseen ja on tarkoitettu räätälöityjen generatiivisten tekoälymallien luomiseen suuressa mittakaavassa. Se rakentuu Transformers v5 -kirjaston päälle lisäten asiantuntijarinnakkaisuuden (Expert Parallelism), DeepEP:n yhdistetyn all-to-all -välityksen ja TransformerEngine-ytimet, ja se hyödyntää dynaamista painojen latausta v5:ssä soveltaakseen näitä optimointeja laajaan malliperhevalikoimaan. Tuloksena on 3,4–3,7-kertainen harjoituksen läpäisykyvyn kasvu ja 29–32 %:n GPU-muistinkäytön vähennys MoE-mallien hienosäädössä verrattuna alkuperäiseen Transformers v5:een samaa from_pretrained()-rajapintaa käyttäen – riittää, että vaihtaa yhden import-rivin eikä muuta muuta koodia. NeMoAutoModelForCausalLM on AutoModelForCausalLM:n alaluokka, joten kaikki HF-mallien kanssa toimiva koodi toimii myös AutoModelin kanssa. Suosituille MoE-arkkitehtuureille (Qwen3, NVIDIA Nemotron, GPT-OSS, DeepSeek V3) NeMo AutoModel käyttää erityisiä toteutuksia, joissa on TransformerEngine-attentio, koverretut lineaariset kerrokset ja mukautetut asiantuntijaytimet. Muille malleille sovelletaan optimoitua vararatkaisua Liger-ytimillä. Suorituskykymittaukset osoittivat: kun hienosäädettiin Nemotron 3 Ultra 550B A55B -mallia 16 solmulla (128 GPU), NeMo AutoModel saavutti 815 tunnusta/s per GPU ja 293 TFLOP/s per GPU, huippumuistin ollessa 58,2 Gt, kun taas Transformers v5 ei kyennyt käynnistymään tässä mittakaavassa muistinpuutteen vuoksi. Yhden solmun testeissä 8 GPU:lla Qwen3-30B-A3B:lla NeMo AutoModel tuotti 11 340 tunnusta/s per GPU (vrt. 3 075 v5:llä, 3,69-kertainen nopeutus) ja huippumuisti 48,1 Gt (29 % vähemmän kuin v5:n 68,2 Gt). Nemotron 3 Nano 30B A3B:lla tulokset olivat: 15 421 tunnusta/s (vrt. 4 583, 3,36-kertainen nopeutus) ja 42,5 Gt muistia (32 % vähemmän kuin v5:n 62,1 Gt). Nopeutus saavutetaan kolmen tekijän ansiosta: asiantuntijarinnakkaisuus vähentää muistinpainetta, DeepEP yhdistää viestinnän ja laskennan, ja TransformerEngine-ytimet nopeuttavat perustoimintoja.
Lähde: Hugging Face blog —
Alkuperäinen
