NVIDIA AI phát hành Molt: Khung học tăng cường tác tử gốc PyTorch
NVIDIA
Nhóm NeMo của NVIDIA đã mở mã nguồn Molt, một khung học tăng cường tác tử nhỏ gọn, gốc PyTorch, phát hành theo giấy phép Apache 2.0. Với khoảng 8,6 nghìn dòng mã học tăng cường, khung này nhằm giảm chi phí cho nhà nghiên cứu bằng cách kết hợp Ray, vLLM và NVIDIA AutoModel mà không cần fork, đồng thời hỗ trợ các bất biến đúng đắn như định danh token và phát lại định tuyến triển khai. Các công thức đi kèm giả định 2 nút, mỗi nút 8 GPU H100, nhắm tới các phòng thí nghiệm tiên phong và liền kề.
Đội ngũ NeMo của NVIDIA đã phát hành Molt, một framework học tăng cường đại lý (agentic reinforcement learning) thuần PyTorch được thiết kế để giảm chi phí nghiên cứu khi liên tục sửa đổi các thuật toán RL. Mã nguồn được thiết kế gọn nhẹ có chủ đích—khoảng 8,6K dòng mã RL, so với khoảng 62K dòng của verl và 25K của slime—giúp các nhà nghiên cứu và trợ lý lập trình AI có thể nắm bắt toàn bộ. Molt có thể triển khai theo giấy phép Apache 2.0 kèm mã khởi chạy, script Slurm và container dựng sẵn, nhưng bài báo xem nó như hạ tầng nghiên cứu, không phải dịch vụ sản xuất. Các cấu hình đi kèm giả định 2 nút với 8 GPU H100, chia thành 8 cho huấn luyện và 8 cho rollout, đưa nó vào tầm với của các phòng thí nghiệm tiên tiến, startup được tài trợ tốt, nhóm nghiên cứu doanh nghiệp và phòng thí nghiệm học thuật có quyền truy cập nhiều nút H100/H200. Molt kết hợp Ray cho việc sắp xếp và hàng đợi, vLLM cho rollout, và NVIDIA AutoModel với FSDP2 cho huấn luyện—không có phần nào được fork, nên các cải tiến từ upstream sẽ đến dưới dạng pin container. Runtime sử dụng một nhóm agent gồm các engine vLLM phía sau bộ định tuyến yêu cầu và một actor chính sách duy nhất có thể huấn luyện, với việc rollout một phần tạm dừng engine và phát broadcast các mảnh actor qua NCCL. Một lần chạy RL xuất ra module AgentRunner, hỗ trợ Env (step() tuân theo Gymnasium) hoặc ChatAgent (vòng lặp do người dùng sở hữu qua OpenAI hoặc Anthropic SDK) thông qua máy chủ loopback đảm bảo tích lũy token chính xác. Các bất biến đúng thiết kế bao gồm danh tính token, ngữ nghĩa phiên bản chính sách và tính nhất quán feed-forward; đối với các chính sách mixture-of-experts, Molt áp dụng rollout routing replay khi vLLM trả về id chuyên gia cho từng token và forward huấn luyện để replay chúng. Throughput có độ tương đương thống kê với stack dựa trên Megatron, với caveat về sự không khớp MoE được tiết lộ, và cùng một vòng lặp chạy được mô hình 4B dense hoặc MoE 700B với --fsdp.ep_size 256.
Nguồn: MarkTechPost —
bản gốc
