Perangkat Keras & InferensiSumber Terbuka 🇺🇸 24.07.2026 02:04

Nunchaku Lite Bawa Inferensi Difusi 4-bit ke Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite, integrasi baru di Hugging Face Diffusers, memungkinkan pemuatan model difusi terkuantisasi 4-bit dengan panggilan from_pretrained() sederhana, tanpa pipeline khusus atau kompilasi CUDA lokal. Ini mengurangi VRAM hingga 50% dan mempercepat inferensi sekitar 1,35x, dengan peningkatan lebih lanjut melalui torch.compile.
Nunchaku Lite adalah jalur integrasi baru di Hugging Face Diffusers yang menghadirkan inferensi 4-bit untuk model difusi, berdasarkan metode kuantisasi SVDQuant di balik mesin inferensi Nunchaku yang populer. Tidak seperti kuantisasi bobot-saja standar, SVDQuant menjalankan lapisan transformer utama dengan bobot dan aktivasi 4-bit (W4A4), mengurangi memori dan mempercepat loop denoising. Dengan Nunchaku Lite, memuat checkpoint terkuantisasi semudah memanggil from_pretrained() tanpa memerlukan kompilasi CUDA lokal, berkat paket kernels Hugging Face. Dua famili kernel digunakan: svdq_w4a4 untuk proyeksi attention dan MLP (tersedia dalam varian INT4 dan NVFP4) dan awq_w4a16 untuk lapisan normalisasi. Checkpoint NVFP4 memerlukan GPU NVIDIA Blackwell (seri RTX 50, RTX PRO 6000, B200), sedangkan varian INT4 mendukung GPU Turing/Ampere/Ada (seri RTX 30 & 40, A100, L40S). Tolok ukur pada RTX PRO 6000 menunjukkan percepatan 1,35x dan pengurangan VRAM hingga 50% dibandingkan dasar BF16; menggabungkannya dengan torch.compile menghasilkan percepatan 1,8x. Toolkit pendamping diffuse-compressor memungkinkan pengguna untuk mengkuantisasi model mereka sendiri dan mempublikasikannya sebagai repositori Diffusers biasa.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru