Arnés 🇺🇸 02.08.2026 10:01

NVIDIA AI lanza Molt: un framework de aprendizaje por refuerzo agéntico nativo de PyTorch

NVIDIANVIDIA
El equipo de NeMo de NVIDIA ha publicado como código abierto Molt, un framework compacto de aprendizaje por refuerzo agéntico nativo de PyTorch bajo licencia Apache 2.0. Con aproximadamente 8.6 mil líneas de código de RL, busca reducir la carga de trabajo de los investigadores al componer Ray, vLLM y NVIDIA AutoModel sin necesidad de bifurcaciones, y admite invariantes de corrección como la identidad de tokens y la reproducción de enrutamiento de despliegue. Las recetas incluidas asumen 2 nodos de 8 GPU H100, dirigidas a laboratorios frontera y adyacentes.
El equipo de NeMo de NVIDIA ha lanzado Molt, un framework de aprendizaje por refuerzo agéntico nativo de PyTorch diseñado para reducir la sobrecarga de investigación de modificar constantemente los algoritmos de RL. El código es intencionalmente compacto—alrededor de 8.6K líneas de código RL, en comparación con aproximadamente 62K para verl y 25K para slime—de modo que los investigadores y asistentes de codificación de IA puedan comprenderlo por completo. Molt es desplegable bajo Apache 2.0 con códigos de lanzamiento, scripts Slurm y un contenedor preconstruido, pero el documento lo posiciona como infraestructura de investigación, no como un servicio de producción. Las recetas incluidas asumen 2 nodos de 8 GPUs H100, divididos con 8 para entrenamiento y 8 para rollout, lo que lo pone al alcance de laboratorios punteros, startups bien financiadas, grupos de investigación empresariales y laboratorios académicos con acceso multi-nodo a H100/H200. Molt compone Ray para la colocación y las colas, vLLM para el rollout y NVIDIA AutoModel con FSDP2 para el entrenamiento—ninguno bifurcado, por lo que las mejoras ascendentes llegan como un pin de contenedor. El runtime utiliza un pool de agentes de motores vLLM detrás de un enrutador de solicitudes y un único actor de política entrenable, con pausa parcial de los motores de rollout y transmisión de fragmentos del actor a través de NCCL. Una ejecución de RL exporta un módulo AgentRunner, que admite Env (paso() alineado con Gymnasium) o ChatAgent (bucle propiedad del usuario a través del SDK de OpenAI o Anthropic) a través de un servidor de bucle invertido que asegura la acumulación exacta de tokens. Los invariantes de corrección del diseño incluyen identidad de tokens, semántica de versión de política y consistencia hacia adelante; para políticas de mezcla de expertos, Molt aplica la reproducción de enrutamiento de rollout donde vLLM devuelve identificadores de experto por token y el forward de entrenamiento los reproduce. El rendimiento es estadísticamente comparable a una pila basada en Megatron, con la advertencia de desajuste de MoE divulgada, y el mismo bucle ejecuta un modelo denso de 4B o un MoE de 700B con --fsdp.ep_size 256.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas