16 के बजाय 3 बिट: टर्बोक्वांट को तोड़ना और इसे कब सक्षम करना है

Google/DeepMindGoogle/DeepMind MistralMistral Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen NVIDIANVIDIA
गूगल का टर्बोक्वांट एल्गोरिदम भाषा मॉडलों के केवी-कैश को बिना फिर से प्रशिक्षण या अंशांकन के 5-6 गुना संपीड़ित करता है, जिससे मेमोरी निर्माताओं में घबराहट पैदा हो गई है। '8 गुना गति' और 'शून्य हानि' के प्रचार के बावजूद, वास्तविक लाभ मेमोरी बचत है, जो समान हार्डवेयर पर लंबे संदर्भ सक्षम करता है। लेख समीक्षा करता है कि यह कैसे काम करता है, इसकी सीमाएं, और केवीटीसी, रोटरक्वांट और केआईवीआई जैसे विकल्पों के साथ तुलना करता है।
मार्च 2026 में, Google ने TurboQuant के बारे में एक पोस्ट प्रकाशित की, जो भाषा मॉडल के लिए एक मेमोरी कम्प्रेशन एल्गोरिदम है, जिससे बाजार में घबराहट फैल गई क्योंकि मेमोरी निर्माताओं के शेयरों ने एक सप्ताह में संयुक्त बाजार पूंजीकरण में लगभग 90 बिलियन डॉलर का नुकसान उठाया। यह एल्गोरिदम केवी-कैश समस्या का समाधान करता है: जैसे-जैसे एलएलएम (LLM) टेक्स्ट जनरेट करते हैं, वे सभी पिछले टोकन के लिए मध्यवर्ती गणनाएँ संग्रहीत करते हैं, जो संदर्भ लंबाई के साथ रैखिक रूप से बढ़ती हैं और दसियों गीगाबाइट का उपभोग कर सकती हैं। उदाहरण के लिए, 128K संदर्भ पर लामा 3.1 70B के लिए केवी-कैश BF16 में लगभग 40 GB घेरता है, जिससे इसे एकल H100 GPU पर फिट करना असंभव हो जाता है। TurboQuant केवी-कैश को 5-6 गुना संपीड़ित करता है, वेक्टरों पर क्वांटाइजेशन से पहले एक यादृच्छिक रोटेशन लागू करके, उसके बाद एक इष्टतम लॉयड-मैक्स क्वांटाइज़र, बिना कैलिब्रेशन या फाइन-ट्यूनिंग के। यह डेटा-अज्ञेय दृष्टिकोण किसी भी ट्रांसफॉर्मर मॉडल पर काम करता है। Google का दावा है 'H100 GPU पर 8 गुना तक गति', लेकिन समुदाय के विश्लेषण से पता चलता है कि यह FP32 के मुकाबले मापा गया है; वास्तविक गति केवल ध्यान के लिए लगभग 4 गुना है, और मेमोरी की बचत वास्तविक लाभ है। छोटे मॉडलों (8B तक) पर बेंचमार्क LongBench और Needle-in-a-Haystack पर शून्य सटीकता हानि दिखाते हैं, लेकिन 70B+ मॉडल के लिए कोई डेटा नहीं है, और 104B मॉडल पर सामुदायिक परीक्षण केवल 3.6% perplexity वृद्धि दिखाते हैं। KVTC (20 गुना तक संपीड़न लेकिन कैलिब्रेशन की आवश्यकता होती है), RotorQuant (तेज़ रोटेशन लेकिन कम गुणवत्ता), और KIVI (16 गुना संपीड़न, हगिंग फेस में एकीकृत) जैसे विकल्पों के साथ तुलना एक व्यापक तस्वीर प्रदान करती है। आधिकारिक कोड की कमी 15 से अधिक सामुदायिक कार्यान्वयनों द्वारा कम की गई है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार