ruGPT-3 XL 1.3B को आधुनिक LLM स्तर पर फ़ाइन-ट्यून करना और Gemma3 1B से तुलना
Сбербанк
Google/DeepMind
2020 के पुराने ruGPT-3 XL 1.3B मॉडल को SFT और DPO विधियों का उपयोग करके फ़ाइन-ट्यून किया गया, जिससे यह एक आधुनिक निर्देश-अनुसरण करने वाला LLM बन गया। परिणाम की तुलना 2025 के Gemma3 1B मॉडल से की गई, जिसमें दिखाया गया कि फ़ाइन-ट्यून किया गया ruGPT अक्सर तर्क और रचनात्मकता में Gemma3 से बेहतर प्रदर्शन करता है, हालाँकि इसे नकारात्मक निर्देशों और भूमिका निभाने में कठिनाई होती है।
मूल रूप से 2020 का एक प्रीट्रेन मॉडल ruGPT-3 XL 1.3B, जो केवल टेक्स्ट जारी रख सकता था, को SFT (पर्यवेक्षित फाइन-ट्यूनिंग) और DPO (प्रत्यक्ष प्राथमिकता अनुकूलन) का उपयोग करके फाइन-ट्यून किया गया, जिससे एक आधुनिक निर्देश-अनुसरण LLM बनाया गया। saiga_preferences से लिए गए 42 मिलियन टोकन डेटासेट पर SFT के बाद, मॉडल ने निर्देशों का पालन करना, प्रश्नों के उत्तर देना और बहु-टर्न वार्तालाप बनाए रखना सीखा। फिर इसकी तुलना Gemma3 1B से की गई, जो 2 ट्रिलियन टोकन पर प्रशिक्षित 2025 का मॉडल है। फाइन-ट्यून किए गए ruGPT ने रूसी रॉक बैंड ज्ञान, बहु-चरणीय वार्तालाप, क्वांटम भौतिकी प्रश्न और एक स्थानिक पहेली जैसे कार्यों में बेहतर प्रदर्शन किया। इसने कई पुनर्जनन प्रयासों के बाद नकारात्मक निर्देशों (जैसे, एक विशिष्ट शब्द से बचना) को भी संभाला, जबकि Gemma3 रोल-प्ले और टर्मिनल सिमुलेशन को छोड़कर अधिकांश कार्यों में विफल रहा, जहाँ ruGPT को कठिनाई हुई। DPO ने संरेखण को और बेहतर बनाया, हालांकि लेख में नोट किया गया है कि छोटे SFT डेटासेट ने सामान्यीकरण को सीमित किया।
स्रोत: Habr — хаб ML —
मूल
