16 के बजाय 3 बिट: टर्बोक्वांट को तोड़ना और इसे कब सक्षम करना है
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
गूगल का टर्बोक्वांट एल्गोरिदम भाषा मॉडलों के केवी-कैश को बिना फिर से प्रशिक्षण या अंशांकन के 5-6 गुना संपीड़ित करता है, जिससे मेमोरी निर्माताओं में घबराहट पैदा हो गई है। '8 गुना गति' और 'शून्य हानि' के प्रचार के बावजूद, वास्तविक लाभ मेमोरी बचत है, जो समान हार्डवेयर पर लंबे संदर्भ सक्षम करता है। लेख समीक्षा करता है कि यह कैसे काम करता है, इसकी सीमाएं, और केवीटीसी, रोटरक्वांट और केआईवीआई जैसे विकल्पों के साथ तुलना करता है।
मार्च 2026 में, Google ने TurboQuant के बारे में एक पोस्ट प्रकाशित की, जो भाषा मॉडल के लिए एक मेमोरी कम्प्रेशन एल्गोरिदम है, जिससे बाजार में घबराहट फैल गई क्योंकि मेमोरी निर्माताओं के शेयरों ने एक सप्ताह में संयुक्त बाजार पूंजीकरण में लगभग 90 बिलियन डॉलर का नुकसान उठाया। यह एल्गोरिदम केवी-कैश समस्या का समाधान करता है: जैसे-जैसे एलएलएम (LLM) टेक्स्ट जनरेट करते हैं, वे सभी पिछले टोकन के लिए मध्यवर्ती गणनाएँ संग्रहीत करते हैं, जो संदर्भ लंबाई के साथ रैखिक रूप से बढ़ती हैं और दसियों गीगाबाइट का उपभोग कर सकती हैं। उदाहरण के लिए, 128K संदर्भ पर लामा 3.1 70B के लिए केवी-कैश BF16 में लगभग 40 GB घेरता है, जिससे इसे एकल H100 GPU पर फिट करना असंभव हो जाता है। TurboQuant केवी-कैश को 5-6 गुना संपीड़ित करता है, वेक्टरों पर क्वांटाइजेशन से पहले एक यादृच्छिक रोटेशन लागू करके, उसके बाद एक इष्टतम लॉयड-मैक्स क्वांटाइज़र, बिना कैलिब्रेशन या फाइन-ट्यूनिंग के। यह डेटा-अज्ञेय दृष्टिकोण किसी भी ट्रांसफॉर्मर मॉडल पर काम करता है। Google का दावा है 'H100 GPU पर 8 गुना तक गति', लेकिन समुदाय के विश्लेषण से पता चलता है कि यह FP32 के मुकाबले मापा गया है; वास्तविक गति केवल ध्यान के लिए लगभग 4 गुना है, और मेमोरी की बचत वास्तविक लाभ है। छोटे मॉडलों (8B तक) पर बेंचमार्क LongBench और Needle-in-a-Haystack पर शून्य सटीकता हानि दिखाते हैं, लेकिन 70B+ मॉडल के लिए कोई डेटा नहीं है, और 104B मॉडल पर सामुदायिक परीक्षण केवल 3.6% perplexity वृद्धि दिखाते हैं। KVTC (20 गुना तक संपीड़न लेकिन कैलिब्रेशन की आवश्यकता होती है), RotorQuant (तेज़ रोटेशन लेकिन कम गुणवत्ता), और KIVI (16 गुना संपीड़न, हगिंग फेस में एकीकृत) जैसे विकल्पों के साथ तुलना एक व्यापक तस्वीर प्रदान करती है। आधिकारिक कोड की कमी 15 से अधिक सामुदायिक कार्यान्वयनों द्वारा कम की गई है।
स्रोत: Habr — хаб ИИ —
मूल
