NVIDIA AI Lança Molt: Um Framework de Aprendizado por Reforço Agêntico Nativo em PyTorch
NVIDIA
A equipe NeMo da NVIDIA disponibilizou em código aberto o Molt, um framework compacto de aprendizado por reforço agêntico nativo em PyTorch sob a licença Apache 2.0. Com cerca de 8,6 mil linhas de código de RL, visa reduzir a sobrecarga dos pesquisadores ao compor Ray, vLLM e NVIDIA AutoModel sem a necessidade de forks, e suporta invariantes de correção, como identidade de token e replay de roteamento de rollout. As receitas fornecidas assumem 2 nós de 8 GPUs H100, direcionadas a laboratórios de ponta e adjacentes.
A equipe NeMo da NVIDIA lançou o Molt, um framework de aprendizado por reforço agêntico nativo em PyTorch, projetado para reduzir a sobrecarga de pesquisa de modificar constantemente algoritmos de RL. O código-fonte é intencionalmente compacto—cerca de 8,6 mil linhas de código de RL, em comparação com aproximadamente 62 mil do verl e 25 mil do slime—para que pesquisadores e assistentes de codificação de IA possam compreendê-lo por completo. O Molt é implantável sob a licença Apache 2.0, com códigos de inicialização, scripts Slurm e um contêiner pré-construído, mas o artigo o posiciona como infraestrutura de pesquisa, não como um serviço de produção. As receitas fornecidas assumem 2 nós de 8 GPUs H100, divididos com 8 para treinamento e 8 para rollout, colocando-o ao alcance de laboratórios de ponta, startups bem financiadas, grupos de pesquisa empresariais e laboratórios acadêmicos com acesso multi-nó a H100/H200. O Molt combina Ray para alocação e filas, vLLM para rollout e NVIDIA AutoModel com FSDP2 para treinamento—nenhum deles modificado, para que melhorias upstream cheguem como uma fixação de contêiner. O tempo de execução usa um pool de agentes de mecanismos vLLM atrás de um roteador de solicitações e um único ator de política treinável, com rollout parcial pausando mecanismos e transmitindo fragmentos do ator via NCCL. Uma execução de RL exporta um módulo AgentRunner, suportando Env (passo() alinhado ao Gymnasium) ou ChatAgent (loop de propriedade do usuário via OpenAI ou SDK da Anthropic) através de um servidor loopback que garante acúmulo token-exato. As invariantes de correção do projeto incluem identidade de token, semântica de versão de política e consistência direta; para políticas de mistura de especialistas, o Molt aplica replay de roteamento de rollout, onde o vLLM retorna IDs de especialistas por token e o forward de treinamento os reproduz. A taxa de transferência é estatisticamente comparável a uma pilha baseada em Megatron, com a ressalva da incompatibilidade de MoE divulgada, e o mesmo loop executa um modelo denso de 4B ou um MoE de 700B com --fsdp.ep_size 256.
Fonte: MarkTechPost —
original
