الأدوات 🇺🇸 02.08.2026 10:01

NVIDIA AI تطلق Molt: إطار عمل تعلم التعزيز الوكيل الأصلي لـ PyTorch

NVIDIANVIDIA
قام فريق NeMo في NVIDIA بفتح مصدر إطار عمل Molt، وهو إطار عمل تعلم تعزيز وكيل مضغوط أصلي لـ PyTorch بموجب رخصة Apache 2.0. يتكون من حوالي 8.6 ألف سطر من كود تعلم التعزيز، ويهدف إلى تقليل الأعباء على الباحثين من خلال دمج Ray وvLLM وNVIDIA AutoModel دون تفرع، ويدعم ثوابت الصحة مثل هوية الرموز وإعادة تشغيل توجيه التشغيل. تفترض الوصفات المرفقة عقدين من 8 وحدات معالجة رسومية H100، وتستهدف المختبرات الرائدة والمجاورة.
أصدر فريق NeMo في NVIDIA إطار عمل Molt، وهو إطار تعلم معزز وكيل قائم على PyTorch، مصمم لتقليل العبء البحثي الناتج عن التعديل المستمر لخوارزميات التعلم المعزز. قاعدة الكود مضغوطة عمدًا — حوالي 8.6 ألف سطر من كود التعلم المعزز، مقارنة بنحو 62 ألفًا لـ verl و25 ألفًا لـ slime — بحيث يمكن للباحثين ومساعدي البرمجة بالذكاء الاصطناعي فهمها بالكامل. يمكن نشر Molt بموجب ترخيص Apache 2.0 مع أكواد الإطلاق، ونصوص Slurm، وحاوية مُعدة مسبقًا، لكن الورقة البحثية تضعه كبنية تحتية بحثية، وليس خدمة إنتاجية. تفترض الوصفات المرفقة عقدين من 8 وحدات معالجة رسومية H100، مقسمة إلى 8 للتدريب و8 للطرح، مما يجعله في متناول مختبرات الحدود، والشركات الناشئة الممولة جيدًا، ومجموعات البحث في المؤسسات، والمختبرات الأكاديمية التي لديها إمكانية الوصول إلى عقد متعددة من H100/H200. يجمع Molt بين Ray للتوزيع والصفوف، وvLLM للطرح، وNVIDIA AutoModel مع FSDP2 للتدريب — دون أي تفرعات، لذا تصل التحسينات من المصادر العلوية كتثبيت حاوية. يستخدم بيئة التشغيل مجموعة عوامل من محركات vLLM خلف موجه طلبات وعامل سياسة واحد قابل للتدريب، مع طرح جزئي يوقف المحركات مؤقتًا ويبث أجزاء العامل عبر NCCL. يُصدِّر تشغيل التعلم المعزز وحدة AgentRunner، تدعم Env (خطوة متوافقة مع Gymnasium) أو ChatAgent (حلقة يملكها المستخدم عبر SDK من OpenAI أو Anthropic) عبر خادم حلقة مغلقة يضمن تراكمًا دقيقًا للرموز. تتضمن ثوابت صحة التصميم هوية الرمز، ودلالات إصدار السياسة، واتساق التوجيه الأمامي؛ بالنسبة لسياسات خليط الخبراء، يطبق Molt إعادة تشغيل توجيه الطرح حيث يُرجع vLLM معرّفات الخبراء لكل رمز ويعيد تشغيلها التوجيه الأمامي للتدريب. الإنتاجية قابلة للمقارنة إحصائيًا بمكدس مبني على Megatron، مع الإفصاح عن ملاحظة عدم تطابق خليط الخبراء، وتعمل نفس الحلقة على نموذج كثيف 4B أو نموذج خليط خبراء 700B مع --fsdp.ep_size 256.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة