NVIDIA Yapay Zeka, Molt'u Yayınladı: PyTorch Yerli Ajanlı Takviyeli Öğrenme Çerçevesi
NVIDIA
NVIDIA'nın NeMo ekibi, Apache 2.0 lisansı altında, kompakt bir PyTorch yerli ajanlı takviyeli öğrenme çerçevesi olan Molt'u açık kaynak olarak yayınladı. Yaklaşık 8,6K satır Takviyeli Öğrenme kodu içeren bu çerçeve, Ray, vLLM ve NVIDIA AutoModel'i fork etmeden birleştirerek araştırmacıların yükünü azaltmayı hedefliyor ve token kimliği ile rulman yönlendirme tekrarı gibi doğruluk değişmezlerini destekliyor. Sağlanan tarifler, iki düğümde 8 H100 GPU varsayıyor ve öncü ve komşu laboratuvarları hedefliyor.
NVIDIA'nın NeMo ekibi, RL algoritmalarını sürekli değiştirmenin araştırma yükünü azaltmak için tasarlanmış, PyTorch tabanlı bir aracı takviye öğrenme çerçevesi olan Molt'u yayınladı. Kod tabanı kasıtlı olarak kompakt—yaklaşık 8,6K satır RL kodu, verl için yaklaşık 62K ve slime için 25K'ya kıyasla—böylece araştırmacılar ve yapay zeka kodlama asistanları tamamını kavrayabilir. Molt, Apache 2.0 lisansı altında, başlatma kodları, Slurm betikleri ve önceden oluşturulmuş bir konteyner ile dağıtılabilir, ancak makale bunu üretim hizmeti değil, araştırma altyapısı olarak konumlandırıyor. Sunulan tarifler, 8'i eğitim ve 8'i dağıtım için ayrılmış 2 düğüm 8 H100 GPU varsayar ve bu da onu sınır laboratuvarlarının, iyi finanse edilen girişimlerin, kurumsal araştırma gruplarının ve çok düğümlü H100/H200 erişimi olan akademik laboratuvarların erişimine sokar. Molt, yerleştirme ve kuyruklar için Ray, dağıtım için vLLM ve eğitim için FSDP2 ile NVIDIA AutoModel kullanır—hiçbiri çatallanmamıştır, böylece yukarı akış iyileştirmeleri bir konteyner sabitlemesi olarak gelir. Çalışma zamanı, bir istek yönlendiricisinin arkasında vLLM motorlarından oluşan bir aracı havuzu ve tek bir eğitilebilir politika aktörü kullanır; kısmi dağıtım motorları duraklatır ve aktör parçalarını NCCL aracılığıyla yayınlar. Bir RL çalışması, bir Geri Döngü Sunucusu üzerinden OpenAI veya Anthropic SDK aracılığıyla Env (Gymnasium uyumlu step()) veya ChatAgent (kullanıcı tarafından yönetilen döngü) destekleyen bir AgentRunner modülü dışa aktarır; bu sunucu, belirteç açısından birebir birikim sağlar. Tasarım doğruluk değişmezleri, belirteç kimliğini, politika sürümü semantiğini ve ileri tutarlılığı içerir; uzman karışımı politikaları için Molt, vLLM'nin belirteç başına uzman kimlikleri döndürdüğü ve eğitim ileri geçişinin bunları yeniden oynattığı dağıtım yönlendirme tekrarını uygular. Verim, Megatron tabanlı bir yığınla istatistiksel olarak karşılaştırılabilir; MoE uyumsuzluğu uyarısı açıklanmıştır ve aynı döngü, --fsdp.ep_size 256 ile yoğun bir 4B modeli veya 700B MoE'yi çalıştırır.
Kaynak: MarkTechPost —
orijinal
