OPPO का AICon शेन्ज़ेन में ऑन-डिवाइस मल्टीमॉडल एलएलएम इंजीनियरिंग अभ्यास
OPPO
MediaTek
Qualcomm
OPPO के मल्टीमॉडल एल्गोरिदम विशेषज्ञ डॉ. Xiyu Yu, AICon शेन्ज़ेन 2026 में ऑन-डिवाइस मल्टीमॉडल बड़े भाषा मॉडल के लिए OPPO के फुल-स्टैक इंजीनियरिंग अभ्यास साझा करेंगे। यह वार्ता क्वांटाइज़ेशन-अवेयर ट्रेनिंग (क्यूएटी), स्पार्स कंप्रेशन, लॉन्ग-कॉन्टेक्स्ट कैश एविक्शन, डिकोडिंग एक्सेलेरेशन और संसाधन-सीमित उपकरणों पर अनुमान विलंबता, इंजीनियरिंग जटिलता और वैयक्तिकरण को संबोधित करने के लिए स्वचालित QALFT पाइपलाइनों को शामिल करती है।
OPPO के डॉ. शियु यू ने AICon शेन्ज़ेन 2026 सम्मेलन में डिवाइस पर मल्टीमोडल लार्ज लैंग्वेज मॉडल (एलएलएम) इंजीनियरिंग प्रैक्टिस विषय पर बोलने की पुष्टि की है। उनका भाषण लंबे संदर्भ परिदृश्यों में प्रीफिल/डिकोडिंग विलंबता, प्रशिक्षण संपीड़न से लेकर डिप्लॉयमेंट तक जटिल इंजीनियरिंग पाइपलाइन, और मॉडल पुनरावृत्ति एवं वैयक्तिकरण में कठिनाइयों जैसी मुख्य चुनौतियों को संबोधित करेगा। OPPO के फुल-स्टैक दृष्टिकोण में स्पार्स ट्रेनिंग, एविक्शन-अवेयर QAT और डिकोडिंग एक्सेलेरेशन को एकीकृत करने वाला मॉड्यूलर QAT प्रशिक्षण ढांचा शामिल है। एक स्वचालित QALFT पाइपलाइन डेटा तैयारी, PTQ (पोस्ट-ट्रेनिंग क्वांटाइजेशन)/QAT (क्वांटाइजेशन अवेयर ट्रेनिंग), QALFT फाइन-ट्यूनिंग, सटीकता सत्यापन, और MTK तथा Qualcomm प्लेटफार्मों पर प्रदर्शन प्रोफाइलिंग को कवर करती है। स्पार्स पर्टरबेशन का उपयोग करके शून्य-कोटि ऑप्टिमाइजेशन गोपनीयता-संरक्षण वैयक्तिकरण के लिए डिवाइस पर प्रशिक्षण को सक्षम बनाता है। इस अभ्यास को 10 से अधिक ऊर्ध्वाधर व्यावसायिक परिदृश्यों में लागू किया गया है, जो डिवाइस पर एजेंट क्षमताओं के तेजी से पुनरावृत्ति का समर्थन करता है। भविष्य की दिशाओं में लंबे संदर्भों के लिए कुशल अटेंशन और KV कैश प्रबंधन, कम बिट-चौड़ाई क्वांटाइजेशन, और मल्टीमोडल समझ एवं एजेंट योजना का एकीकृत ऑप्टिमाइजेशन शामिल है। यह सम्मेलन 21-22 अगस्त, 2026 को होगा, जिसमें शीर्ष टेक कंपनियों के 50 से अधिक विशेषज्ञ शामिल होंगे।
स्रोत: InfoQ 中国 —
मूल
