Nunchaku Lite يجلب استدلال الانتشار بدقة 4 بت إلى Diffusers
Hugging Face
Baidu
Nunchaku Lite، وهو تكامل جديد في Hugging Face Diffusers، يتيح تحميل نماذج الانتشار المكممة بدقة 4 بت باستدعاء بسيط من from_pretrained()، دون الحاجة إلى خطوط أنابيب مخصصة أو تجميع محلي لـ CUDA. يقلل من ذاكرة VRAM بنسبة تصل إلى 50% ويسرع الاستدلال بحوالي 1.35 مرة، مع تحسينات إضافية عبر torch.compile.
Nunchaku Lite هو مسار تكامل جديد في Hugging Face Diffusers يتيح الاستدلال بدقة 4 بت لنماذج الانتشار، استنادًا إلى طريقة التكميم SVDQuant المستخدمة في محرك الاستدلال الشهير Nunchaku. على عكس التكميم التقليدي القائم على الوزن فقط، يقوم SVDQuant بتشغيل طبقات المحول الرئيسية بأوزان وتفعيلات بدقة 4 بت (W4A4)، مما يقلل من استهلاك الذاكرة ويسرع حلقة إزالة الضوضاء. باستخدام Nunchaku Lite، يصبح تحميل نقطة تفتيش مكممة بسيطًا مثل استدعاء from_pretrained() دون الحاجة إلى تجميع CUDA محلي، وذلك بفضل حزمة Hugging Face kernels. يتم استخدام عائلتين من النوى: svdq_w4a4 لتوقعات الانتباه وتوقع طبقات MLP (متوفرة بنسختي INT4 و NVFP4) و awq_w4a16 لطبقات التطبيع. تتطلب نقاط التفتيش من نوع NVFP4 معالج رسوميات NVIDIA Blackwell (سلسلة RTX 50، RTX PRO 6000، B200)، بينما تدعم متغيرات INT4 معالجات Turing/Ampere/Ada (سلسلة RTX 30 و 40، A100، L40S). تظهر الاختبارات على RTX PRO 6000 تسريعًا بمقدار 1.35 مرة وتقليلًا في ذاكرة الوصول العشوائي للفيديو (VRAM) يصل إلى 50% مقارنة بالحالة الأساسية BF16؛ والجمع مع torch.compile يحقق تسريعًا بمقدار 1.8 مرة. تسمح مجموعة الأدوات المساعدة diffuse-compressor للمستخدمين بتكميم نماذجهم الخاصة ونشرها كمستودعات Diffusers عادية.
المصدر: Hugging Face blog —
الأصلي
