Harness 🇺🇸 02.08.2026 10:01

NVIDIA AI Merilis Molt: Kerangka Kerja Reinforcement Learning Agentiik yang Asli PyTorch

NVIDIANVIDIA
Tim NeMo NVIDIA telah membuka sumber kode Molt, kerangka kerja reinforcement learning agentik yang ringkas dan asli PyTorch di bawah lisensi Apache 2.0. Dengan sekitar 8.6 ribu baris kode RL, Molt bertujuan mengurangi beban kerja peneliti dengan mengomposisikan Ray, vLLM, dan NVIDIA AutoModel tanpa melakukan fork, serta mendukung invarian kebenaran seperti identitas token dan replay perutean peluncuran. Resep yang disertakan mengasumsikan 2 node dengan 8 GPU H100, menargetkan laboratorium terdepan dan sekitarnya.
Tim NeMo dari NVIDIA telah merilis Molt, sebuah kerangka kerja pembelajaran penguatan (reinforcement learning) agentik yang berbasis PyTorch dan dirancang untuk mengurangi beban riset akibat seringnya modifikasi algoritma RL. Basis kode Molt sengaja dibuat ringkas—sekitar 8,6K baris kode RL, dibandingkan dengan sekitar 62K baris untuk verl dan 25K untuk slime—sehingga para peneliti dan asisten pengkode AI dapat memahaminya secara keseluruhan. Molt dapat digunakan di bawah lisensi Apache 2.0 dengan kode peluncuran, skrip Slurm, dan kontainer yang telah disiapkan, tetapi makalahnya menempatkan Molt sebagai infrastruktur riset, bukan layanan produksi. Resep yang disertakan mengasumsikan 2 node dengan 8 GPU H100, dibagi menjadi 8 untuk pelatihan dan 8 untuk rollout, sehingga dapat diakses oleh laboratorium mutakhir, perusahaan rintisan yang didanai dengan baik, kelompok riset perusahaan, dan laboratorium akademis dengan akses multi-node H100/H200. Molt menggabungkan Ray untuk penempatan dan antrean, vLLM untuk rollout, dan NVIDIA AutoModel dengan FSDP2 untuk pelatihan—tidak ada yang di-fork, sehingga peningkatan dari hulu tiba sebagai pin kontainer. Runtime menggunakan kumpulan agen mesin vLLM di belakang perute permintaan dan satu aktor kebijakan yang dapat dilatih, dengan penundaan mesin secara parsial saat rollout dan penyiaran pecahan aktor melalui NCCL. Proses RL mengekspor modul AgentRunner, mendukung Env (step() yang selaras dengan Gymnasium) atau ChatAgent (loop yang dimiliki pengguna melalui SDK OpenAI atau Anthropic) melalui server loopback yang memastikan akumulasi token yang tepat. Invariansi kebenaran desain mencakup identitas token, semantik versi kebijakan, dan konsistensi maju; untuk kebijakan mixture-of-experts, Molt menerapkan pemutaran ulang perutean rollout di mana vLLM mengembalikan id pakar per token dan forward pelatihan memutarnya ulang. Throughput secara statistik sebanding dengan tumpukan berbasis Megatron, dengan catatan ketidakcocokan MoE yang diungkapkan, dan loop yang sama menjalankan model 4B padat atau MoE 700B dengan --fsdp.ep_size 256.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru