Perangkat Keras & InferensiSumber Terbuka 🇺🇸 24.07.2026 02:04

Nunchaku Lite: 4-bit Inference of Diffusion Models in Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku is a quantization method SVDQuant (W4A4) for diffusion transformers. The new Nunchaku Lite integration allows loading quantized checkpoints directly via from_pretrained() in Diffusers, without a separate engine. Generation speed increases up to 1.8x, peak VRAM consumption drops up to 50%.
Di blog Hugging Face, diumumkan integrasi metode kuantisasi Nunchaku (berbasis SVDQuant) ke dalam pustaka Diffusers. SVDQuant bekerja dengan bobot dan aktivasi 4-bit (W4A4) serta menangani outlier dengan memindahkannya ke bobot, menyisakan cabang rank-rendah 16-bit yang kecil. Mesin Nunchaku asli memerlukan integrasi terpisah untuk setiap arsitektur. Nunchaku Lite mengatasi masalah ini dengan mengganti modul nn.Linear dari model difusi dengan lapisan linier khusus yang menggunakan kernel CUDA (svdq_w4a4 untuk komputasi utama dan awq_w4a16 untuk lapisan normalisasi). Checkpoint dimuat menggunakan panggilan standar from_pretrained(), dan konfigurasi kuantisasi disimpan dalam config.json model. Nunchaku Lite memberikan peningkatan kecepatan sekitar 30% dan pengurangan VRAM hingga 50% dibandingkan BF16. Dengan torch.compile, percepatan mencapai 1,8 kali lipat. Metode ini mendukung GPU Blackwell (NVFP4) dan Turing/Ampere/Ada (INT4). Untuk kuantisasi model sendiri, disediakan perangkat diffuse-compressor yang secara otomatis menentukan target kuantisasi dan mengemas hasilnya ke dalam format Diffusers.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru