NVIDIA AI ने जारी किया Molt: एक PyTorch-नेटिव एजेंटिक रीइन्फोर्समेंट लर्निंग फ्रेमवर्क
NVIDIA
NVIDIA की NeMo टीम ने Apache 2.0 लाइसेंस के तहत Molt नामक एक कॉम्पैक्ट PyTorch-नेटिव एजेंटिक रीइन्फोर्समेंट लर्निंग फ्रेमवर्क को ओपन-सोर्स किया है। लगभग 8.6K लाइनों के RL कोड के साथ, इसका उद्देश्य Ray, vLLM और NVIDIA AutoModel को फोर्क किए बिना संयोजित करके शोधकर्ताओं का ओवरहेड कम करना है, और टोकन पहचान और रोलआउट रूटिंग रीप्ले जैसी सहीता इनवेरिएंट्स का समर्थन करता है। शिप किए गए रेसिपी 8 H100 GPU के 2 नोड्स मानते हैं, जो फ्रंटियर और आस-पास की लैब्स को लक्षित करते हैं।
NVIDIA की NeMo टीम ने Molt जारी किया है, जो एक PyTorch-मूल एजेंटिक रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है, जिसे RL एल्गोरिदम को लगातार संशोधित करने के शोध ओवरहेड को कम करने के लिए डिज़ाइन किया गया है। कोडबेस जानबूझकर कॉम्पैक्ट है—लगभग 8.6K लाइनों का RL कोड, जबकि verl के लिए लगभग 62K और slime के लिए 25K है—ताकि शोधकर्ता और AI कोडिंग सहायक इसे पूरी तरह से समझ सकें। Molt Apache 2.0 के तहत लॉन्च कोड, Slurm स्क्रिप्ट और पहले से निर्मित कंटेनर के साथ तैनात करने योग्य है, लेकिन पेपर इसे शोध बुनियादी ढांचे के रूप में प्रस्तुत करता है, उत्पादन सेवा के रूप में नहीं। शिप किए गए व्यंजन 2 नोड्स के 8 H100 GPU मानते हैं, जिसमें 8 प्रशिक्षण के लिए और 8 रोलआउट के लिए विभाजित हैं, जो इसे फ्रंटियर लैब, अच्छी तरह से वित्त पोषित स्टार्टअप, उद्यम शोध समूहों और मल्टी-नोड H100/H200 एक्सेस वाली शैक्षणिक लैब की पहुंच में रखता है। Molt प्लेसमेंट और कतारों के लिए Ray, रोलआउट के लिए vLLM, और प्रशिक्षण के लिए FSDP2 के साथ NVIDIA AutoModel का उपयोग करता है—कोई भी फोर्क नहीं किया गया है, इसलिए अपस्ट्रीम सुधार कंटेनर पिन के रूप में आते हैं। रनटाइम एक अनुरोध राउटर के पीछे vLLM इंजनों का एजेंट पूल और एकल प्रशिक्षण योग्य नीति अभिनेता का उपयोग करता है, जिसमें आंशिक रोलआउट इंजन को रोकता है और NCCL के माध्यम से अभिनेता शार्ड प्रसारित करता है। एक RL रन AgentRunner मॉड्यूल निर्यात करता है, जो Env (Gymnasium-संरेखित step()) या ChatAgent (ओपनAI या Anthropic SDK के माध्यम से उपयोगकर्ता-स्वामित्व वाला लूप) का समर्थन करता है, जो एक लूपबैक सर्वर के माध्यम से टोकन-सटीक संचय सुनिश्चित करता है। डिजाइन शुद्धता अपरिवर्तनीय में टोकन पहचान, नीति-संस्करण शब्दार्थ और फॉरवर्ड स्थिरता शामिल हैं; मिश्रण-ऑफ-एक्सपर्ट्स नीतियों के लिए, Molt रोलआउट रूटिंग रीप्ले लागू करता है जहां vLLM प्रति-टोकन विशेषज्ञ आईडी लौटाता है और प्रशिक्षण फॉरवर्ड उन्हें रीप्ले करता है। थ्रूपुट सांख्यिकीय रूप से Megatron-आधारित स्टैक के बराबर है, जिसमें MoE-मिसमैच सीमा का खुलासा किया गया है, और वही लूप --fsdp.ep_size 256 पर घने 4B मॉडल या 700B MoE चलाता है।
स्रोत: MarkTechPost —
मूल
