Valjaat 🇺🇸 02.08.2026 10:01

NVIDIA AI julkaisee Moltin: PyTorch-pohjainen agenttinen vahvistusoppimiskehys

NVIDIANVIDIA
NVIDIAn NeMo-tiimi on avannut Moltin lähdekoodin, joka on kompakti PyTorch-pohjainen agenttinen vahvistusoppimiskehys Apache 2.0 -lisenssillä. Noin 8 600 rivin vahvistusoppimiskoodilla se pyrkii vähentämään tutkijoiden työmäärää yhdistämällä Ray:n, vLLM:n ja NVIDIA AutoModel:n ilman haarukointia, ja tukee oikeellisuusinvariantteja, kuten token-identiteettiä ja rolloute-reitityksen toistoa. Mukana toimitetut reseptit olettavat 2 solmua, joissa kussakin on 8 H100-GPU:ta, ja ne on suunnattu huippulaboratorioille ja niiden lähialan toimijoille.
NVIDIAn NeMo-tiimi on julkaissut Moltin, PyTorch-natiivin agenttioppimisen (agentic reinforcement learning) -viitekehyksen, joka on suunniteltu vähentämään RL-algoritmien jatkuvaan muokkaamiseen liittyvää tutkimustyön kuormitusta. Koodikanta on tarkoituksella kompakti – noin 8,6 tuhatta riviä RL-koodia verrattuna noin 62 tuhanteen riviin verlissä ja 25 tuhanteen riviin slime:ssä – joten tutkijat ja tekoälyavusteiset koodausympäristöt voivat omaksua sen kokonaisuudessaan. Molt on asennettavissa Apache 2.0 -lisenssillä, ja siihen sisältyy käynnistyskoodit, Slurm-skriptit ja valmiiksi rakennettu kontti, mutta paperi esittelee sen tutkimusinfrastruktuurina, ei tuotantopalveluna. Toimitetut reseptit olettavat 2 solmua, joissa kussakin on 8 H100-näytönohjainta, jaettuna niin, että 8 on harjoitukseen ja 8 rullaukseen (rollout), mikä tekee siitä saavutettavan huippulaboratorioille, hyvin rahoitetuille startup-yrityksille, yritysten tutkimusryhmille ja akateemisille laboratorioille, joilla on usean solmun H100/H200-käyttöoikeus. Molt yhdistää Rayn resurssien sijoitteluun ja jonoihin, vLLM:n rullaukseen ja NVIDIA AutoModelin FSDP2:n kanssa harjoitukseen – mitään näistä ei ole haarukoitu, joten ylävirran parannukset saapuvat konttipäivityksenä. Suoritusaika käyttää vLLM-moottoreiden agenttipoolia pyyntöreitittimen ja yhden harjoitettavan politiikka-agentin takana, ja osittainen rullaus pysäyttää moottorit ja lähettää agentin osat NCCL:n kautta. RL-ajosta viedään AgentRunner-moduuli, joka tukee Env (Gymnasium-yhteensopiva step()-metodi) tai ChatAgent (käyttäjän omistama silmukka OpenAI- tai Anthropic-SDK:n kautta) -rajapintoja loopback-palvelimen kautta, joka varmistaa token-tarkkuuden kerrytyksen. Suunnittelun oikeellisuusinvariantteja ovat token-identiteetti, politiikkaversiosemantiikka ja eteenpäinlaskennan johdonmukaisuus; sekoitettuasiantuntija-politiikoille (mixture-of-experts) Molt soveltaa rullauksen reitityksen toistoa, jossa vLLM palauttaa tokenkohtaiset asiantuntija-tunnukset ja harjoituksen eteenpäinlaskenta toistaa ne. Suorituskyky on tilastollisesti verrattavissa Megatron-pohjaiseen pinoon, ja MoE-epäsovitus-huomautus on ilmoitettu, ja sama silmukka ajaa tiheän 4 miljardin parametrin mallin tai 700 miljardin parametrin MoE-mallin --fsdp.ep_size 256 -asetuksella.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset