하네스 🇺🇸 02.08.2026 10:01

엔비디아 AI, PyTorch 기반 에이전트 강화학습 프레임워크 'Molt' 공개

NVIDIANVIDIA
엔비디아의 네모(NeMo) 팀이 아파치 2.0 라이선스 하에 PyTorch 네이티브 에이전트 강화학습 프레임워크인 Molt를 오픈소스로 공개했습니다. 약 8,600줄의 강화학습 코드로 구성되어 있으며, 연구자들이 Ray, vLLM, 엔비디아 AutoModel을 포크 없이 조합할 수 있도록 하여 오버헤드를 줄이는 것을 목표로 합니다. 또한 토큰 정체성 및 롤아웃 라우팅 재생과 같은 정확성 불변식을 지원합니다. 제공되는 레시피는 8개의 H100 GPU가 장착된 2개 노드를 가정하며, 최첨단 연구소 및 인접 연구소를 대상으로 합니다.
NVIDIA의 NeMo 팀은 RL 알고리즘을 지속적으로 수정하는 연구 오버헤드를 줄이기 위해 설계된 PyTorch 네이티브 에이전트 강화 학습 프레임워크인 Molt를 출시했습니다. 코드베이스는 의도적으로 간결하여 RL 코드가 약 8.6K줄로, verl의 약 62K줄과 slime의 25K줄에 비해 훨씬 작아 연구자와 AI 코딩 어시스턴트가 전체를 파악할 수 있습니다. Molt는 Apache 2.0에 따라 배포 가능하며, 시작 코드, Slurm 스크립트, 사전 구축된 컨테이너를 포함하지만, 논문에서는 이를 프로덕션 서비스가 아닌 연구 인프라로 설명합니다. 제공된 레시피는 8개의 H100 GPU가 장착된 2개 노드를 가정하며, 훈련용 8개와 롤아웃용 8개로 나누어져 있어, 최첨단 연구소, 자금력이 풍부한 스타트업, 기업 연구 그룹, 그리고 멀티 노드 H100/H200에 접근할 수 있는 학계 연구소가 사용할 수 있습니다. Molt는 Ray를 배치 및 큐 관리에, vLLM을 롤아웃에, NVIDIA AutoModel을 FSDP2와 함께 훈련에 사용하며, 이들 중 어떤 것도 포크하지 않아 업스트림 개선 사항이 컨테이너 핀으로 제공됩니다. 런타임은 요청 라우터 뒤의 vLLM 엔진 에이전트 풀과 단일 훈련 가능한 정책 액터를 사용하며, 부분 롤아웃은 엔진을 일시 중지하고 NCCL을 통해 액터 샤드를 브로드캐스트합니다. RL 실행은 AgentRunner 모듈을 내보내며, Env(Gymnasium 정렬 step()) 또는 ChatAgent(OpenAI 또는 Anthropic SDK를 통한 사용자 소유 루프)를 루프백 서버를 통해 지원하여 토큰 정확한 누적을 보장합니다. 설계 정확성 불변식에는 토큰 식별, 정책 버전 의미론, 순방향 일관성이 포함되며, 전문가 혼합 정책의 경우 Molt는 롤아웃 라우팅 재생을 적용하여 vLLM이 토큰별 전문가 ID를 반환하고 훈련 순방향이 이를 재생합니다. 처리량은 Megatron 기반 스택과 통계적으로 비교 가능하며, MoE 불일치 제한 사항이 공개되어 있으며, 동일한 루프가 --fsdp.ep_size 256으로 밀집 4B 모델 또는 700B MoE를 실행합니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스