शोध 🇨🇳 30.07.2026 19:03

हानि अभिसरण का अर्थ सीखना नहीं है: Tencent Hunyuan ACL 2026 में SFT प्रशिक्षण के 15.3% "झूठी सीखने" के नमूनों का विश्लेषण करता है

TencentTencent
Tencent Hunyuan ने ACL 2026 में एक अध्ययन प्रकाशित किया है जिसमें दिखाया गया है कि पर्यवेक्षित फाइन-ट्यूनिंग (SFT) के दौरान, हानि अभिसरण यह गारंटी नहीं देता कि मॉडल ने वास्तव में सीखा है। उन्होंने पहचाना कि 15.3% प्रशिक्षण नमूने "झूठी सीखने" के मामले हैं जहाँ हानि कम होती है लेकिन मॉडल वास्तव में अभीष्ट ज्ञान प्राप्त नहीं करता है। शोध इन नमूनों का पता लगाने की एक विधि प्रदान करता है और SFT में सुधार के सुझाव देता है।
टेनसेंट ह्युनयुआन ने ACL 2026 में एक शोध प्रस्तुत किया जिसमें पर्यवेक्षित फाइन-ट्यूनिंग (SFT) में "झूठी सीखने" (false learning) की घटना का विश्लेषण किया गया। अध्ययन से पता चलता है कि भले ही प्रशिक्षण हानि (training loss) अभिसरित हो जाए, लेकिन मॉडल ने वास्तव में लक्ष्य ज्ञान को सीखा नहीं हो सकता। उन्होंने पाया कि SFT में 15.3% नमूनों में यह झूठी सीखने की घटना होती है, जहाँ हानि कम होती है लेकिन मॉडल सामान्यीकरण करने में विफल रहता है। टीम ने ऐसे नमूनों की पहचान करने के लिए एक पता लगाने की विधि विकसित की और झूठी सीखने को कम करने की तकनीकें प्रस्तावित कीं, जिससे SFT की विश्वसनीयता में सुधार हुआ।
स्रोत: Tencent Hunyuan (GNews) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार