मॉडल 🇷🇺 24.07.2026 10:02

स्क्रैच से अपना खुद का Warhammer 40K GPT-जैसा LLM बनाना। भाग 4: प्रश्न-उत्तर पर सुपरवाइज्ड फाइन-ट्यूनिंग

Hugging FaceHugging Face
डिकोडर-ओनली LLM को स्क्रैच से बनाने की श्रृंखला का चौथा भाग, जो संवाद को सक्षम करने के लिए प्रश्न-उत्तर डेटासेट पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) पर केंद्रित है। लेखक टोकनाइज़र को विशेष भूमिका टोकन के साथ विस्तारित करता है, एक QA डेटासेट बनाता है, और मॉडल को फाइन-ट्यून करता है, यह देखते हुए कि लॉस कम होने पर भी, ओवरफिटिंग के कारण जनरेशन की गुणवत्ता खराब हो सकती है। चेकपॉइंट का चयन न्यूनतम लॉस के बजाय जनरेशन गुणवत्ता के आधार पर किया जाता है।
लेख एक छोटे डिकोडर-केवल LLM को Warhammer 40K के ज्ञान के लिए प्रशिक्षण के SFT चरण का वर्णन करता है। पूर्व-प्रशिक्षण के बाद, बेस मॉडल टेक्स्ट को जारी रख सकता है लेकिन प्रश्नों का उत्तर नहीं दे सकता। लेखक फोरम, लेखों और सिंथेटिक डेटा से प्रश्न-उत्तर जोड़े एकत्र करता है, फिर एक ChatQADataset बनाता है जो केवल असिस्टेंट टोकन पर लॉस को मास्क करता है। टोकनाइज़र को विशेष टोकन <|user|> और <|assistant|> के साथ विस्तारित किया जाता है। नए टोकन को समायोजित करने के लिए मॉडल की एम्बेडिंग और आउटपुट लेयर्स का आकार बदला जाता है। फाइन-ट्यूनिंग एक कम लर्निंग रेट (1e-5) का उपयोग करती है और लगभग 20 मिनट तक चलती है। हालांकि लॉस 3.7 से घटकर 2.1 हो जाता है, लेखक ओवरफिटिंग को नोट करता है और जनरेशन गुणवत्ता के आधार पर चेकपॉइंट चुनने की सिफारिश करता है। एक तुलना दिखाती है कि बेस मॉडल संवाद जैसा टेक्स्ट आउटपुट करता है जबकि फाइन-ट्यून मॉडल प्रश्न का उत्तर देने का प्रयास करता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार