मैंने Gemma 4 से अच्छी रूसी कविता लिखवाने में कैसे असफल रहा: ओवरफिटिंग और अंधे मेट्रिक्स की एक चेतावनी भरी कहानी
Google/DeepMind
एआई इंजीनियर Daniil Sheremet ने एक महीना Gemma 4 को सही मीटर और तुक के साथ रूसी कविता लिखने के लिए फाइन-ट्यून करने में बिताया, लेकिन सभी फाइन-ट्यून किए गए संस्करण बेस मॉडल से खराब प्रदर्शन किए। असली दोष मॉडल का नहीं, बल्कि एक दोषपूर्ण मूल्यांकन प्रणाली का था: एक कस्टम ग्रेडर जो कविता को गद्य से अलग नहीं कर सकता था, साथ ही तनाव चिह्नों (स्ट्रेस मार्क्स) के साथ टोकनाइजेशन की समस्या। ग्रेडर को ठीक करने और उचित A/B परीक्षण चलाने के बाद, बेस मॉडल जीत गया, जो LLM आउटपुट का मूल्यांकन करने के बारे में एक महत्वपूर्ण सबक को उजागर करता है।
एजेंटिक लैब में AI इंजीनियर डैनियल शेरेमेट ने जेम्मा 4 को सही आयंबिक छंद और तुक के साथ रूसी कविता लिखने के लिए एक महीना बिताया। उनकी योजना में LoRA, एक आलोचक-पुनरीक्षक प्रणाली, प्रतिबंधित डिकोडिंग, और अन्य तकनीकों के साथ फाइन-ट्यूनिंग शामिल थी। उन्होंने इल्या कोज़ीरेव के RPST टूल से प्रेरित एक कस्टम कविता स्कैनर बनाया ताकि छंद और तुक का मूल्यांकन किया जा सके। उन्होंने ArsPoetica से डेटासेट तैयार किया, जिसमें नियंत्रण टैग के साथ 13,342 प्रशिक्षण जोड़े शामिल थे। पहला LoRA रन (v1) ने अजीब शब्द जैसे 'नागोस्ती' और 'गुंटी' पैदा किए, जो ओवरफिटिंग और प्रशिक्षण लक्ष्यों में तनाव चिह्नों के उपयोग के कारण थे, जिससे टोकन विखंडित हो गए। दूसरा रन (v2) स्वच्छ लक्ष्यों और कम लर्निंग रेट के साथ अधिक सुसंगत लेकिन फिर भी त्रुटिपूर्ण कविता उत्पन्न करता था, और एक A/B परीक्षण ने सुझाव दिया कि यह बेस मॉडल से बेहतर था। हालांकि, मूल्यांकन ग्रेडर अंधा निकला: यह कविता को गद्य से अलग नहीं कर सका, और पिछली सभी रैंकिंग शोर थीं। ग्रेडर को एक न्यूरल एक्सेंटुएटर (RUAccent), बेहतर तुक पहचान, और पुनर्भारित मेट्रिक्स के साथ ठीक करने के बाद, बेस जेम्मा 4 मॉडल ने औसत और सर्वश्रेष्ठ-4 स्कोर दोनों में फाइन-ट्यून किए गए संस्करणों को पीछे छोड़ दिया। फाइन-ट्यून किए गए मॉडल ने तुक की कीमत पर छंद को अनुकूलित किया, बिल्कुल वही सीखा जो टैग ने जोर दिया था। यह कहानी मजबूत मूल्यांकन और फाइन-ट्यूनिंग में विदेशी टोकन स्थान से बचने के महत्व को उजागर करती है।
स्रोत: Habr — хаб ИИ —
मूल
