SPEX और ProxySPEX: बड़े पैमाने पर LLMs में प्रभावशाली अंतःक्रियाओं की पहचान करने की विधियाँ
OpenAI
BAIR (बर्कले एआई) के शोधकर्ताओं ने SPEX और ProxySPEX नामक एल्गोरिद्म प्रस्तुत किए — ये एल्गोरिद्म एआई मॉडलों, जिनमें LLMs भी शामिल हैं, की विशेषताओं, डेटा और घटकों के बीच महत्वपूर्ण अंतःक्रियाओं को मौजूदा तरीकों की तुलना में कई गुना तेजी से पहचानने में सक्षम हैं। ये विधियाँ प्रभावशाली अंतःक्रियाओं की विरलता के विचार पर आधारित हैं और कोडिंग सिद्धांत तथा सिग्नल प्रोसेसिंग की तकनीकों का उपयोग करती हैं। SPEX के अनुप्रयोग ने दिखाया कि मानक आरोपण विधियाँ (जैसे SHAP) जटिल सहक्रियाओं को छोड़ सकती हैं, जैसा कि ट्रॉली समस्या के मामले में हुआ। ProxySPEX, जो पदानुक्रम के गुण का लाभ उठाता है, लगभग 10 गुना कम एब्लेशन के साथ समान सटीकता प्राप्त करता है।
BAIR (बर्कले आर्टिफिशियल इंटेलिजेंस रिसर्च) के शोधकर्ताओं ने SPEX और ProxySPEX एल्गोरिदम विकसित किए हैं ताकि बड़े भाषा मॉडल (LLMs) सहित जटिल मशीन लर्निंग सिस्टम के घटकों के बीच प्रभावशाली अंतःक्रियाओं की पहचान की जा सके। चुनौती यह है कि संभावित अंतःक्रियाओं की संख्या फीचर्स, डेटा पॉइंट्स या आंतरिक घटकों की संख्या के साथ तेजी से बढ़ती है, जिससे व्यापक गणना कम्प्यूटेशनल रूप से अव्यावहारिक हो जाती है। SPEX स्पार्सिटी और निम्न-डिग्री धारणाओं का लाभ उठाता है: वास्तव में प्रभावशाली अंतःक्रियाओं की संख्या कम होती है, और वे तत्वों के केवल एक छोटे उपसमूह को शामिल करती हैं। कोडिंग थ्योरी से रणनीतिक रूप से चयनित एब्लेशन और स्पार्स रिकवरी एल्गोरिदम का उपयोग करके, SPEX इन अंतःक्रियाओं को कुशलतापूर्वक पहचानता है। ProxySPEX आगे पदानुक्रम का शोषण करता है: यदि एक उच्च-क्रम अंतःक्रिया महत्वपूर्ण है, तो इसके निचले-क्रम उपसमूह भी महत्वपूर्ण होते हैं, जिससे SPEX की तुलना में एब्लेशन की संख्या लगभग दस गुना कम हो जाती है। फीचर एट्रीब्यूशन कार्यों में, SPEX ने लंबे संदर्भों (हजारों फीचर्स) पर मौजूदा तरीकों से बेहतर प्रदर्शन किया। उदाहरण के लिए, एक संशोधित 'ट्रॉली समस्या' में, मानक SHAP विधि ने GPT-4o mini के गलत उत्तर का श्रेय 'ट्रॉली' जैसे व्यक्तिगत शब्दों को दिया, जबकि SPEX ने 'ट्रॉली' के दो उदाहरणों और 'पुलिंग' तथा 'लेवर' के बीच सिनर्जी की पहचान की; इन चार शब्दों को पर्यायवाची शब्दों से बदलने से मॉडल की त्रुटि दर लगभग शून्य हो गई। डेटा एट्रीब्यूशन में, ProxySPEX ने CIFAR-10 पर ResNet के लिए प्रशिक्षण नमूनों के बीच सिनर्जिस्टिक और रिडंडेंट अंतःक्रियाओं को सफलतापूर्वक उजागर किया। मैकेनिस्टिक इंटरप्रिटेबिलिटी (कम्पोनेंट एट्रीब्यूशन) में, विधि ने दिखाया कि विभिन्न LLM परतों में अटेंशन हेड कैसे परस्पर क्रिया करते हैं और अन्य विधियों की तुलना में प्रूनिंग के बाद लक्ष्य मॉडल के प्रदर्शन में सुधार किया। SPEX और ProxySPEX का कोड SHAP-IQ रिपॉजिटरी में उपलब्ध है।
स्रोत: BAIR (Berkeley AI) —
मूल
