Nunchaku Lite लाया Diffusers में 4-बिट डिफ्यूज़न इंफ़रेंस
Hugging Face
Baidu
Nunchaku Lite, Hugging Face Diffusers में एक नया एकीकरण, एक सरल from_pretrained() कॉल के साथ 4-बिट क्वांटाइज़्ड डिफ्यूज़न मॉडल लोड करने की अनुमति देता है, बिना कस्टम पाइपलाइनों या स्थानीय CUDA कंपाइलेशन के। यह VRAM को 50% तक कम करता है और इंफ़रेंस को लगभग 1.35x गति देता है, torch.compile के माध्यम से और लाभ प्राप्त होते हैं।
Nunchaku Lite, हगिंग फेस डिफ्यूज़र्स में एक नया एकीकरण पथ है, जो लोकप्रिय Nunchaku इन्फ़रेंस इंजन के पीछे की SVDQuant क्वांटाइज़ेशन विधि पर आधारित डिफ्यूज़न मॉडल के लिए 4-बिट इन्फ़रेंस लाता है। मानक वेट-ओनली क्वांटाइज़ेशन के विपरीत, SVDQuant मुख्य ट्रांसफ़ॉर्मर लेयर्स को 4-बिट वेट और एक्टिवेशन (W4A4) के साथ चलाता है, जिससे मेमोरी कम होती है और डीनॉइज़िंग लूप तेज़ होता है। Nunchaku Lite के साथ, क्वांटाइज़्ड चेकपॉइंट लोड करना उतना ही सरल है जितना कि from_pretrained() को कॉल करना, और हगिंग फेस कर्नेल पैकेज की बदौलत किसी स्थानीय CUDA कंपाइलेशन की आवश्यकता नहीं है। दो कर्नेल परिवारों का उपयोग किया जाता है: अटेंशन और MLP प्रोजेक्शन के लिए svdq_w4a4 (INT4 और NVFP4 वेरिएंट में उपलब्ध) और नॉर्मलाइज़ेशन लेयर्स के लिए awq_w4a16। NVFP4 चेकपॉइंट के लिए NVIDIA Blackwell GPU (RTX 50 सीरीज़, RTX PRO 6000, B200) की आवश्यकता है, जबकि INT4 वेरिएंट Turing, Ampere और Ada GPUs (RTX 30 और 40 सीरीज़, A100, L40S) को सपोर्ट करते हैं। RTX PRO 6000 पर बेंचमार्क BF16 बेसलाइन की तुलना में 1.35 गुना गति और 50% तक VRAM कमी दिखाते हैं; torch.compile के साथ संयोजन से 1.8 गुना गति मिलती है। साथी diffuse-compressor टूलकिट उपयोगकर्ताओं को अपने स्वयं के मॉडलों को क्वांटाइज़ करने और उन्हें नियमित डिफ्यूज़र्स रिपॉज़िटरी के रूप में प्रकाशित करने की अनुमति देता है।
स्रोत: Hugging Face blog —
मूल
