शोधमॉडल 🇨🇳 12.08.2026 16:01

ज़िदोंग ताइचू ने जीएमसी कोरसेट प्रूनिंग विधि पेश की: 80% कम टोकन के साथ पूर्ण मल्टीमॉडल क्षमता बरकरार

चीनी विज्ञान अकादमी के स्वचालन संस्थान की ज़िदोंग ताइचू लार्ज मॉडल टीम ने जीएमसी (ग्राउंडेड मैसेज कोरसेट प्रूनिंग) विकसित किया है, जो एक प्रशिक्षण-रहित कोरसेट प्रूनिंग विधि है जो विज़ुअल टोकन को 90% तक कम करती है जबकि मॉडल के औसत प्रदर्शन का 99% से अधिक बनाए रखती है। जीएमसी विज़न-लैंग्वेज मॉडल में विज़ुअल टोकन की अतिरेकता को संबोधित करता है, जो क़्वेन और एलएलएवीए जैसे मुख्यधारा मॉडल के साथ संगत प्लग-एंड-प्ले समाधान प्रदान करता है।
चीनी विज्ञान अकादमी (Chinese Academy of Sciences) की Zidong Taichu टीम ने विज़न-लैंग्वेज मॉडलों के लिए GMC (Grounded Message Coreset Pruning) नामक एक नई कोरसेट प्रूनिंग विधि पेश की है। विज़ुअल टोकन अक्सर अनावश्यक रूप से दोहराए जाते हैं, जिससे ग्राफ़िक्स प्रोसेसिंग यूनिट (Graphics Processing Unit—GPU) की मेमोरी का अधिक उपयोग होता है और इनफ़रेंस धीमा हो जाता है। पारंपरिक Top-K टोकन फ़िल्टरिंग केवल उच्च स्कोर वाले टोकन रखती है, जो मुख्य (प्रमुख) क्षेत्रों में केंद्रित होते हैं, जिससे जानकारी की हानि और विज़ुअल हैलुसिनेशन (भ्रम) होते हैं। GMC एक दो-चरणीय आर्किटेक्चर का उपयोग करती है: पूरक साक्ष्यों का अनुकूली चयन (complementary evidence adaptive selection) और पॉपुलेशन ट्रांसपोर्ट। पहला चरण उन प्रमुख टोकनों का चयन करता है जो अनकवर किए गए साक्ष्यों को कवर करने में योगदान देते हैं, और इसमें अर्थात्मक, दृश्य और स्थानिक पहलुओं को ध्यान में रखा जाता है। दूसरा चरण हटाए गए टोकनों के हिडन स्टेट्स को प्रतिनिधि टोकनों में मर्ज करता है, जिससे बिना किसी प्रशिक्षण के जानकारी सुरक्षित रहती है। GMC को प्रशिक्षण की आवश्यकता नहीं है, और न ही इसे टास्क लेबल, ऑप्टिकल कैरेक्टर रिकग्निशन (Optical Character Recognition—OCR) मॉडल या किसी बाहरी टूल की ज़रूरत होती है, और यह Qwen2.5-VL और LLaVA-1.5 मॉडलों के साथ काम करती है। प्रयोगों से पता चलता है कि 80.2% टोकन कटौती (1296 से घटकर 256) के साथ, GMC TextVQA, ChartQA और MME जैसे बेंचमार्क पर पूर्ण मॉडल के औसत प्रदर्शन का 97.78% बरकरार रखती है। 90.1% कटौती पर यह 99.11% बनाए रखती है। LLaVA-1.5 पर 128 और 64 टोकन के साथ यह क्रमशः 99.76% और 99.82% प्रदर्शन सुरक्षित रखती है। GMC POPE, AMBER और HallusionBench पर विज़ुअल हैलुसिनेशन को भी कम करती है। लंबे दस्तावेज़ों पर प्रश्न-उत्तर (Question Answering—QA) में यह 1.258 गुना की गति वृद्धि हासिल करती है, की-वैल्यू कैश (Key-Value Cache—KV Cache) को 73.94% तक घटाती है, और उत्तर की गुणवत्ता का 98.87% बनाए रखती है। यह पेपर arXiv पर उपलब्ध है।
स्रोत: QbitAI 量子位 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार