शोधमॉडल 🇷🇺 26.07.2026 21:04

ruGPT-3 XL 1.3B को आधुनिक LLM स्तर पर फ़ाइन-ट्यून करना और Gemma3 1B से तुलना

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
2020 के पुराने ruGPT-3 XL 1.3B मॉडल को SFT और DPO विधियों का उपयोग करके फ़ाइन-ट्यून किया गया, जिससे यह एक आधुनिक निर्देश-अनुसरण करने वाला LLM बन गया। परिणाम की तुलना 2025 के Gemma3 1B मॉडल से की गई, जिसमें दिखाया गया कि फ़ाइन-ट्यून किया गया ruGPT अक्सर तर्क और रचनात्मकता में Gemma3 से बेहतर प्रदर्शन करता है, हालाँकि इसे नकारात्मक निर्देशों और भूमिका निभाने में कठिनाई होती है।
मूल रूप से 2020 का एक प्रीट्रेन मॉडल ruGPT-3 XL 1.3B, जो केवल टेक्स्ट जारी रख सकता था, को SFT (पर्यवेक्षित फाइन-ट्यूनिंग) और DPO (प्रत्यक्ष प्राथमिकता अनुकूलन) का उपयोग करके फाइन-ट्यून किया गया, जिससे एक आधुनिक निर्देश-अनुसरण LLM बनाया गया। saiga_preferences से लिए गए 42 मिलियन टोकन डेटासेट पर SFT के बाद, मॉडल ने निर्देशों का पालन करना, प्रश्नों के उत्तर देना और बहु-टर्न वार्तालाप बनाए रखना सीखा। फिर इसकी तुलना Gemma3 1B से की गई, जो 2 ट्रिलियन टोकन पर प्रशिक्षित 2025 का मॉडल है। फाइन-ट्यून किए गए ruGPT ने रूसी रॉक बैंड ज्ञान, बहु-चरणीय वार्तालाप, क्वांटम भौतिकी प्रश्न और एक स्थानिक पहेली जैसे कार्यों में बेहतर प्रदर्शन किया। इसने कई पुनर्जनन प्रयासों के बाद नकारात्मक निर्देशों (जैसे, एक विशिष्ट शब्द से बचना) को भी संभाला, जबकि Gemma3 रोल-प्ले और टर्मिनल सिमुलेशन को छोड़कर अधिकांश कार्यों में विफल रहा, जहाँ ruGPT को कठिनाई हुई। DPO ने संरेखण को और बेहतर बनाया, हालांकि लेख में नोट किया गया है कि छोटे SFT डेटासेट ने सामान्यीकरण को सीमित किया।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार