Harnais 🇺🇸 02.08.2026 10:01

NVIDIA AI publie Molt : un framework d'apprentissage par renforcement agentique natif PyTorch

NVIDIANVIDIA
L'équipe NeMo de NVIDIA a open-sourcé Molt, un framework compact d'apprentissage par renforcement agentique natif PyTorch sous licence Apache 2.0. Avec environ 8,6 milliers de lignes de code RL, il vise à réduire la charge de travail des chercheurs en composant Ray, vLLM et NVIDIA AutoModel sans duplication, et prend en charge des invariants de correction tels que l'identité des jetons et la relecture du routage des déploiements. Les recettes fournies supposent 2 nœuds de 8 GPU H100, ciblant les laboratoires de pointe et adjacents.
L'équipe NeMo de NVIDIA a publié Molt, un framework d'apprentissage par renforcement agentique natif PyTorch, conçu pour réduire la surcharge de recherche liée à la modification constante des algorithmes de RL. Le code source est volontairement compact — environ 8,6K lignes de code RL, contre environ 62K pour verl et 25K pour slime — afin que les chercheurs et les assistants de codage IA puissent le comprendre entièrement. Molt est déployable sous licence Apache 2.0 avec des codes de lancement, des scripts Slurm et un conteneur préconstruit, mais l'article le positionne comme une infrastructure de recherche, et non comme un service de production. Les recettes fournies supposent 2 nœuds de 8 GPU H100, répartis avec 8 pour l'entraînement et 8 pour le déploiement, ce qui le rend accessible aux laboratoires de pointe, aux startups bien financées, aux groupes de recherche d'entreprise et aux laboratoires académiques disposant d'un accès multi-nœuds H100/H200. Molt compose Ray pour le placement et les files d'attente, vLLM pour le déploiement, et NVIDIA AutoModel avec FSDP2 pour l'entraînement — aucun n'est fork, de sorte que les améliorations en amont arrivent comme une épingle de conteneur. L'exécution utilise un pool d'agents de moteurs vLLM derrière un routeur de requêtes et un seul acteur de politique entraînable, avec un déploiement partiel qui met en pause les moteurs et diffuse les fragments de l'acteur via NCCL. Une exécution RL exporte un module AgentRunner, prenant en charge Env (étape() aligné sur Gymnasium) ou ChatAgent (boucle appartenant à l'utilisateur via le SDK OpenAI ou Anthropic) via un serveur en boucle qui garantit une accumulation exacte des jetons. Les invariants de correction de conception incluent l'identité des jetons, la sémantique de version de politique et la cohérence avant ; pour les politiques de mélange d'experts, Molt applique la relecture du routage de déploiement où vLLM renvoie les identifiants d'experts par jeton et la passe avant d'entraînement les rejoue. Le débit est statistiquement comparable à une pile basée sur Megatron, avec l'avertissement de désaccord MoE divulgué, et la même boucle exécute un modèle dense de 4B ou un MoE de 700B à l'aide de --fsdp.ep_size 256.
Source: MarkTechPost — original
Nos articles précédents sur ce sujet ↓
Infos fraîches