शोधओपन सोर्स 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 पोस्ट-ट्रेनिंग: SFT, DPO, RLVR, GRPO और वेरिफायर-आधारित मूल्यांकन

AllenAIAllenAI
यह ट्यूटोरियल AllenAI के Open Instruct फ्रेमवर्क का उपयोग करके एक भाषा मॉडल के लिए एंड-टू-एंड पोस्ट-ट्रेनिंग पाइपलाइन प्रदर्शित करता है, जिसे 16 GB GPU पर चलाने के लिए अनुकूलित किया गया है। इसमें सुपरवाइज्ड फाइन-ट्यूनिंग (SFT), डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO), और GRPO का उपयोग करके वेरिफाएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR) शामिल है, जिसमें गणितीय उत्तरों के मूल्यांकन के लिए निर्धारक वेरिफायर का उपयोग किया जाता है।
यह ट्यूटोरियल AllenAI के Open Instruct फ्रेमवर्क का उपयोग करके एक कॉम्पैक्ट इंस्ट्रक्शन-ट्यून किए गए भाषा मॉडल के निर्माण के बारे में है। पाइपलाइन में तीन प्रशिक्षण चरण शामिल हैं: सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT), डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO), और वेरिफाएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR) जिसमें GRPO का उपयोग किया गया है, ये सभी 16 GB रनटाइम में फिट होने के लिए अनुकूलित किए गए हैं। यह कार्यान्वयन Open Instruct रिपॉजिटरी का लाभ उठाता है, और DPO लॉस, GRPO लॉस, और लॉग-प्रोबेबिलिटी गणना जैसे कार्यों को चयनात्मक रूप से लोड करता है। LoRA एडेप्टर कॉन्फ़िगर किए गए हैं, और GSM8K डेटा प्रत्येक चरण के लिए तैयार किया गया है। नियतात्मक वेरिफायर (GSM8K, Math, IFEval) का उपयोग उत्पन्न गणितीय उत्तरों को स्कोर करने के लिए किया जाता है। वितरित घटक जैसे कि vLLM, Ray एक्टर्स, और DeepSpeed को हल्के Hugging Face और PyTorch कार्यान्वयन से बदल दिया गया है जो Colab के लिए उपयुक्त हैं। उपयोग किया गया मॉडल Qwen2.5-0.5B-Instruct है।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार