शोधमॉडल 🇨🇳 15.08.2026 11:03

एलएलएम व्याख्यात्मकता के लिए नया मार्ग: 1% से कम डेटा लागत के साथ वेट अपघटन

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen
आईक्वेस्ट रिसर्च, सेफ एआई फोरम, ऑक्सफोर्ड, स्टैनफोर्ड और त्सिंगुआ के शोधकर्ताओं ने स्पार्स वेट डीकंपोजिशन (एसडब्ल्यूडी) प्रस्तावित किया है, जो बड़े भाषा मॉडलों की व्याख्या करने की एक विधि है, जो पूर्व-प्रशिक्षित वेट मैट्रिक्स को स्पार्स कारकों में विघटित करती है, अलग प्रतिस्थापन नेटवर्क प्रशिक्षित करने की आवश्यकता को समाप्त करती है। एसडब्ल्यूडी ट्रांसकोडर जैसे प्रशिक्षण-आधारित बेसलाइनों के लिए आवश्यक डेटा के 1% से कम का उपयोग करता है, 27 बिलियन पैरामीटर मॉडल तक स्केल करता है, और सीधे वेट से सर्किट निष्कर्षण और लक्षित संपादन सक्षम करता है।
IQuest Research Institute, Safe AI Forum, University of Oxford, Stanford University, और Tsinghua University के सहयोगियों के साथ मिलकर, बड़े भाषा मॉडलों की यांत्रिक व्याख्यात्मकता के लिए एक नया दृष्टिकोण प्रस्तावित करता है, जिसे स्पार्स वेट डीकंपोज़िशन (SWD) नाम दिया गया है। किसी मॉडल की परतों का अनुमान लगाने के लिए एक अलग स्पार्स प्रतिनिधित्व नेटवर्क को प्रशिक्षित करने के बजाय, SWD सीधे एक घने वजन मैट्रिक्स को दो स्पार्स मैट्रिक्स A और B में विघटित करता है, जहां साझा मध्यवर्ती आयाम अड़चन इकाइयाँ बन जाते हैं जिन्हें स्वतंत्र रूप से स्कोर, चयन और विलोपित किया जा सकता है। यह शोधकर्ताओं को सीधे वजन से कार्य सर्किट निकालने की अनुमति देता है। प्रतिस्थापन निष्ठा से मेल खाने वाले एकल-मैट्रिक्स प्रयोगों में, SWD प्रशिक्षण-आधारित बेसलाइन जैसे ट्रांसकोडर द्वारा आवश्यक डेटा के 1% से भी कम का उपयोग करता है। GPT-2, Qwen2.5, और Qwen3.5-27B पर, SWD आमतौर पर कम अड़चन इकाइयों और सक्रिय कनेक्शनों के साथ समान पर्याप्तता और आवश्यकता लक्ष्य प्राप्त करता है। यह विधि 27B मॉडल तक स्केल करती है और GPT-2 स्मॉल के सभी 48 ध्यान और MLP वजन मैट्रिक्स को कवर करती है, जिसमें एक शून्य-डेटा संस्करण भी शामिल है जिसमें कैलिब्रेशन टेक्स्ट की आवश्यकता नहीं होती है। पेपर रिपोर्ट करता है कि GPT-2 स्मॉल में, SWD केवल हजारों कैलिब्रेशन टोकन के साथ कम CE डेल्टा प्राप्त करता है, जबकि प्रशिक्षण-आधारित बेसलाइन को लगभग 10^6 टोकन की आवश्यकता होती है। SWD-FT का उपयोग करके GPT-2 स्मॉल पर पूर्ण-मॉडल प्रतिस्थापन, समान संख्या में कनेक्शन के साथ CE को 3.90 से घटाकर 3.44 कर देता है, जिसमें एक स्पार्स प्रीट्रेनिंग बेसलाइन के लिए 2.884 बिलियन की तुलना में लगभग 20.6 मिलियन टोकन का उपयोग होता है। ग्रेटरदैन कार्य पर उच्च-रैंकिंग अड़चन इकाइयों के शब्दार्थ विश्लेषण से पता चलता है कि छह में से चार इकाइयाँ संख्याओं, वर्षों, मात्राओं या मापों पर प्रतिक्रिया करती हैं। एकल इकाई (c205) पर एक लक्षित संपादन प्रयोग ने न्यूनतम दुष्प्रभावों के साथ सही उत्तर के लिए लॉगिट मार्जिन को 0.216 तक बढ़ा दिया, यह प्रदर्शित करते हुए कि SWD-व्युत्पन्न दिशाओं का उपयोग सटीक व्यवहार नियंत्रण के लिए किया जा सकता है।
स्रोत: QbitAI 量子位 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार