Google ने फ्रोजन मल्टी-टोकन प्रेडिक्शन के साथ Pixel पर Gemini Nano मॉडल्स को तेज़ किया

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google ने फ्रोजन प्रोडक्शन मॉडल्स जैसे Gemini Nano v3 पर मल्टी-टोकन प्रेडिक्शन (MTP) को रेट्रोफिट करने की एक विधि पेश की है, जिससे Pixel 9 और 10 उपकरणों पर तेज़ ऑन-डिवाइस इन्फ्रेंस सक्षम होता है। MTP हेड मुख्य मॉडल की अंतिम परतों से जुड़ता है, इसके हिडन स्टेट्स और KV कैश का लाभ उठाकर बिना अलग ड्राफ्टिंग मॉडल के प्रति इन्फ्रेंस पास में कई टोकन उत्पन्न करता है, जिससे 50% या उससे अधिक की गति वृद्धि और प्रति इंस्टेंस 130MB मेमोरी खपत में कमी आती है।
Google Research ने पिक्सेल स्मार्टफोन पर Gemini Nano v3 जैसे ऑन-डिवाइस भाषा मॉडलों को तेज करने के लिए एक नई आर्किटेक्चर की घोषणा की है। यह दृष्टिकोण फ्रीज़ किए गए बेस मॉडल पर अंतिम परतों में एक हल्का Transformer हेड जोड़कर मल्टी-टोकन प्रेडिक्शन (Multi-Token Prediction, MTP) को रेट्रोफिट करता है। यह MTP हेड क्रॉस-अटेंशन के माध्यम से मुख्य मॉडल के मौजूदा की-वैल्यू कैश का सीधे उपयोग करता है, जिससे एक स्टैंडअलोन ड्राफ्टर मॉडल की आवश्यकता समाप्त हो जाती है और प्रति इंस्टेंस मेमोरी ओवरहेड 130 MB कम हो जाती है। AI Notifications Summaries और Proofread जैसे उत्पादन कार्यों में, MTP प्रति इन्फरेंस पास में लगभग दो अतिरिक्त टोकन उत्पन्न करता है, जिससे Pixel 9 उपकरणों पर गति में 50% से अधिक का सुधार होता है। अंतिम आउटपुट बेस मॉडल के समान बिट-आइडेंटिकल होता है, जिससे सुरक्षा संरेखण और पिछड़ी संगतता सुनिश्चित होती है। इस विधि को Pixel 9 और 10 सीरीज़ पर रोल आउट किया गया है, और Google आगे की दक्षता लाभ के लिए पैरेलल डिकोडिंग और वेरिफिकेशन लेनिएंसी का पता लगाने की योजना बना रहा है।
स्रोत: Google Research — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार