Harnassen 🇺🇸 02.08.2026 10:01

NVIDIA AI brengt Molt uit: een PyTorch-native raamwerk voor agentief reinforcement learning

NVIDIANVIDIA
Het NeMo-team van NVIDIA heeft Molt open-sourced, een compact PyTorch-native raamwerk voor agentief reinforcement learning onder Apache 2.0. Met ongeveer 8,6 duizend regels RL-code wil het de overhead voor onderzoekers verminderen door Ray, vLLM en NVIDIA AutoModel te combineren zonder dat er forks nodig zijn, en ondersteunt het correctheidsinvarianten zoals tokenidentiteit en replay van rollout-routing. De meegeleverde recepten gaan uit van 2 nodes met 8 H100-GPU's en richten zich op grensverleggende en naburige laboratoria.
Het NeMo-team van NVIDIA heeft Molt uitgebracht, een agentisch versterkend leerframework dat native in PyTorch is geschreven en bedoeld is om de onderzoeksoverhead van het voortdurend aanpassen van RL-algoritmen te verminderen. De codebase is bewust compact—ongeveer 8.6K regels RL-code, vergeleken met ongeveer 62K voor verl en 25K voor slime—zodat onderzoekers en AI-codeerassistenten het volledig kunnen begrijpen. Molt is inzetbaar onder Apache 2.0 met lanceercodes, Slurm-scripts en een vooraf gebouwde container, maar het artikel positioneert het als onderzoeksinfrastructuur, niet als productiedienst. De meegeleverde recepten gaan uit van 2 nodes met 8 H100 GPU's, verdeeld met 8 voor training en 8 voor rollout, waardoor het binnen bereik ligt van vooraanstaande laboratoria, goed gefinancierde startups, onderzoeksgroepen in het bedrijfsleven en academische laboratoria met toegang tot meerdere nodes met H100/H200. Molt combineert Ray voor plaatsing en wachtrijen, vLLM voor rollout, en NVIDIA AutoModel met FSDP2 voor training—geen enkele is geforkt, zodat upstream-verbeteringen binnenkomen als een container-pin. De runtime gebruikt een agentpool van vLLM-engines achter een requestrouter en één enkele trainbare beleidsactor, met gedeeltelijke rollout die engines pauzeert en actor-shards uitzendt via NCCL. Een RL-run exporteert een AgentRunner-module, die Env (Gymnasium-aligned step()) of ChatAgent (door de gebruiker beheerde loop via OpenAI- of Anthropic-SDK) ondersteunt via een loopback-server die token-exacte accumulatie garandeert. De invarianten voor ontwerpcorrectheid omvatten tokenidentiteit, beleidsversiesemantiek en forward-consistentie; voor mixture-of-experts-beleid past Molt rollout-routing-replay toe waarbij vLLM per-token expert-id's retourneert en de training-forward deze afspeelt. De doorvoer is statistisch vergelijkbaar met een op Megatron gebaseerde stack, met de kanttekening van de MoE-mismatch die wordt vermeld, en dezelfde loop draait een dicht 4B-model of een 700B-MoE met --fsdp.ep_size 256.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws