शोध 🇨🇳 30.07.2026 19:03

लॉस कन्वर्जेंस का मतलब सीखना नहीं है: Tencent Hunyuan ACL 2026 में SFT प्रशिक्षण में 15.3% "फाल्स लर्निंग" नमूनों की पहचान

TencentTencent
Tencent Hunyuan ने ACL 2026 में एक अध्ययन प्रकाशित किया है जो दर्शाता है कि सुपरवाइज़्ड फाइन-ट्यूनिंग (SFT) के दौरान, लॉस कन्वर्जेंस यह गारंटी नहीं देता कि मॉडल ने वास्तव में सीखा है। उन्होंने पाया कि 15.3% प्रशिक्षण नमूने "फाल्स लर्निंग" के मामले हैं जहाँ लॉस घटता है लेकिन मॉडल वास्तव में इच्छित ज्ञान अर्जित नहीं करता। यह शोध इन नमूनों का पता लगाने की एक विधि प्रदान करता है और SFT में सुधार का सुझाव देता है।
टेनसेंट ह्युनयुआन ने ACL 2026 में एक शोध प्रस्तुत किया जिसमें पर्यवेक्षित फाइन-ट्यूनिंग (SFT) में "झूठी सीखने" (false learning) की घटना का विश्लेषण किया गया। अध्ययन से पता चलता है कि भले ही प्रशिक्षण हानि (training loss) अभिसरित हो जाए, लेकिन मॉडल ने वास्तव में लक्ष्य ज्ञान को सीखा नहीं हो सकता। उन्होंने पाया कि SFT में 15.3% नमूनों में यह झूठी सीखने की घटना होती है, जहाँ हानि कम होती है लेकिन मॉडल सामान्यीकरण करने में विफल रहता है। टीम ने ऐसे नमूनों की पहचान करने के लिए एक पता लगाने की विधि विकसित की और झूठी सीखने को कम करने की तकनीकें प्रस्तावित कीं, जिससे SFT की विश्वसनीयता में सुधार हुआ।
स्रोत: Tencent Hunyuan (GNews) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार