स्मरण बनाम सामान्यीकरण: 2160 पैरामीटर वाली भाषा मॉडल वास्तव में क्या कर सकती है
2160 पैरामीटर वाली एक छोटी भाषा मॉडल के साथ किए गए प्रयोग ने प्रशिक्षित पैटर्न की मजबूत याद (99.93% टोकन संभावना), परिचित टोकन के क्रम-परिवर्तन पर सीमित स्थानांतरण (81.69%), और प्रश्न की नई संरचना पर विफलता (10.46%) दिखाई। मॉडल ने बिना किसी विनाशकारी भूल के सभी 14 मूल संबंधों को बरकरार रखा।
Tiny Language Model प्रोजेक्ट के Node.js पर संस्करण 1.1.0 में, ML समुदाय में चर्चा और Hashnode पर इंजीनियरों से मिली प्रतिक्रिया के बाद, याद रखने और सामान्यीकरण के बीच की सीमा का अध्ययन जोड़ा गया। निश्चित seed 42 के साथ चार जाँचों की frozen evaluation की गई: सटीक प्रशिक्षित पैटर्न, नए क्रम में परिचित टोकन, पूरी तरह से अलग रखा गया पैटर्न, और adaptive SFT के बाद 14 संबंधों का संरक्षण। परिणामों से पता चला कि परिचित पैटर्न पर सही टोकन की न्यूनतम संभावना 99.93% थी, टोकन की पुनर्व्यवस्था पर 81.69%, और अज्ञात प्रश्न संरचना पर केवल 10.46% थी, जबकि मॉडल ने अपेक्षित 'cat cannot read' के बजाय 'cat can fly' उत्तर दिया। संबंध संरक्षण का कार्य पूरी तरह से पूरा हुआ (14 में से 14, सटीकता 100%)। प्रयोग दर्शाता है कि मॉडल की क्षमता की सीमा याद रखने और स्थानीय स्थानांतरण तथा वास्तविक सामान्यीकरण के बीच है: मॉडल सीखी हुई बातों को अच्छी तरह दोहराता है और छोटे बदलावों से निपटता है, लेकिन नई संरचना व्यवहार को तोड़ देती है। सीमा का कारण केवल पैरामीटरों की संख्या नहीं है, बल्कि सीमित संख्या में निर्माणों वाला छोटा कोरपस भी है। लेखक ने नोट किया कि अधिक विविध डेटा के बिना न्यूरॉन्स या ब्लॉक बढ़ाने से केवल याद रखने में सुधार होगा। यह एक प्रतिलिपि योग्य शैक्षिक निदान है, पूर्ण बेंचमार्क नहीं।
स्रोत: Habr — хаб ИИ —
मूल
