लॉस कन्वर्जेंस का मतलब सीखना नहीं है: Tencent Hunyuan ACL 2026 में SFT प्रशिक्षण में 15.3% "फाल्स लर्निंग" नमूनों की पहचान
Tencent
Tencent Hunyuan ने ACL 2026 में एक अध्ययन प्रकाशित किया है जो दर्शाता है कि सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT) के दौरान, लॉस कन्वर्जेंस यह गारंटी नहीं देता कि मॉडल ने वास्तव में सीखा है। उन्होंने पाया कि 15.3% प्रशिक्षण नमूने "फाल्स लर्निंग" के मामले हैं जहाँ लॉस घटता है लेकिन मॉडल वास्तव में इच्छित ज्ञान अर्जित नहीं करता। यह शोध इन नमूनों का पता लगाने की एक विधि प्रदान करता है और SFT में सुधार का सुझाव देता है।
टेनसेंट ह्युनयुआन ने ACL 2026 में एक शोध प्रस्तुत किया जिसमें पर्यवेक्षित फाइन-ट्यूनिंग (SFT) में "झूठी सीखने" (false learning) की घटना का विश्लेषण किया गया। अध्ययन से पता चलता है कि भले ही प्रशिक्षण हानि (training loss) अभिसरित हो जाए, लेकिन मॉडल ने वास्तव में लक्ष्य ज्ञान को सीखा नहीं हो सकता। उन्होंने पाया कि SFT में 15.3% नमूनों में यह झूठी सीखने की घटना होती है, जहाँ हानि कम होती है लेकिन मॉडल सामान्यीकरण करने में विफल रहता है। टीम ने ऐसे नमूनों की पहचान करने के लिए एक पता लगाने की विधि विकसित की और झूठी सीखने को कम करने की तकनीकें प्रस्तावित कीं, जिससे SFT की विश्वसनीयता में सुधार हुआ।
स्रोत: Tencent Hunyuan (GNews) —
मूल
