NVIDIA AI、Moltを公開:PyTorchネイティブのエージェント強化学習フレームワーク
NVIDIA
NVIDIAのNeMoチームは、Apache 2.0ライセンスの下で、PyTorchネイティブのエージェント強化学習フレームワーク「Molt」をオープンソース化しました。約8.6K行のRLコードで構成され、Ray、vLLM、NVIDIA AutoModelをフォークせずに組み合わせることで、研究者のオーバーヘッドを削減することを目指しています。また、トークン同一性やロールアウトルーティングリプレイなどの正しさの不変条件をサポートしています。同梱のレシピは、2ノードの8基のH100 GPUを想定しており、最先端の研究所や隣接する研究所を対象としています。
NVIDIAのNeMoチームは、PyTorchネイティブのエージェント型強化学習フレームワーク「Molt」をリリースしました。これは、RLアルゴリズムを頻繁に修正する際の研究オーバーヘッドを削減することを目的としています。コードベースは意図的にコンパクトに設計されており、RLコードは約8.6K行(verlの約62K行、slimeの約25K行と比較)で、研究者やAIコーディングアシスタントが全体を把握できるようになっています。MoltはApache 2.0ライセンスで提供され、起動コード、Slurmスクリプト、事前構築済みコンテナが含まれていますが、論文では研究インフラとして位置付けられており、本番サービスではありません。同梱されているレシピは、2ノードの8基のH100 GPUを想定しており、トレーニング用に8基、ロールアウト用に8基に分割されているため、最先端の研究所、資金力のあるスタートアップ、企業の研究グループ、マルチノードのH100/H200にアクセスできる学術研究所が利用できます。Moltは、配置とキューにRay、ロールアウトにvLLM、トレーニングにFSDP2を備えたNVIDIA AutoModelを統合しており、いずれもフォークされていないため、アップストリームの改善がコンテナピンとして提供されます。ランタイムでは、リクエストルーターと単一のトレーニング可能なポリシーアクターの背後にあるvLLMエンジンのエージェントプールを使用し、部分的なロールアウトではエンジンを一時停止し、NCCLを介してアクターシャードをブロードキャストします。RL実行ではAgentRunnerモジュールをエクスポートし、Env(Gymnasium準拠のstep())またはChatAgent(OpenAIまたはAnthropic SDKを介したユーザー所有ループ)を、ループバックサーバーを介してサポートし、トークン単位の正確な累積を保証します。設計上の正しさの不変条件には、トークンID、ポリシーバージョンセマンティクス、フォワード整合性が含まれます。混合専門家ポリシーの場合、Moltはロールアウトルーティングリプレイを適用し、vLLMがトークンごとの専門家IDを返し、トレーニングフォワードがそれらをリプレイします。スループットはMegatronベースのスタックと統計的に同等であり、MoEのミスマッチの注意点が開示されており、同じループはdense 4Bモデルまたは700BのMoEを--fsdp.ep_size 256で実行できます。
出典: MarkTechPost —
原文
