Donanım ve ÇıkarımAçık Kaynak 🇺🇸 24.07.2026 02:04

Nunchaku Lite, 4-bit Difüzyon Çıkarımını Diffusers'a Getiriyor

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite, Hugging Face Diffusers'a yeni bir entegrasyon olarak, özel ardışık düzenler veya yerel CUDA derlemesi olmadan, basit bir from_pretrained() çağrısı ile 4-bit nicelenmiş difüzyon modellerinin yüklenmesine olanak tanır. VRAM'i yüzde 50'ye kadar azaltır ve çıkarımı yaklaşık 1,35 kat hızlandırır; torch.compile ile daha fazla kazanç sağlanabilir.
Nunchaku Lite, Hugging Face Diffusers'ta, popüler Nunchaku çıkarım motorunun arkasındaki SVDQuant niceleme yöntemine dayanan difüzyon modelleri için 4 bit çıkarım getiren yeni bir entegrasyon yoludur. Standart yalnızca ağırlık nicelemesinden farklı olarak SVDQuant, ana dönüştürücü katmanlarını 4 bit ağırlıklar ve aktivasyonlarla (W4A4) çalıştırarak bellek kullanımını azaltır ve gürültü giderme döngüsünü hızlandırır. Nunchaku Lite ile, niceleme yapılmış bir kontrol noktasını yüklemek, Hugging Face kernels paketi sayesinde yerel CUDA derlemesi gerektirmeden from_pretrained() çağırmak kadar basittir. İki tür kernel kullanılır: dikkat ve MLP projeksiyonları için svdq_w4a4 (INT4 ve NVFP4 varyantları mevcut) ve normalizasyon katmanları için awq_w4a16. NVFP4 kontrol noktaları bir NVIDIA Blackwell GPU (RTX 50 serisi, RTX PRO 6000, B200) gerektirirken, INT4 varyantları Turing/Ampere/Ada GPU'ları (RTX 30 ve 40 serisi, A100, L40S) destekler. RTX PRO 6000 üzerinde yapılan karşılaştırmalarda, BF16 taban çizgisine kıyasla 1,35 kat hızlanma ve %50'ye varan bellek azalması görülmüştür; torch.compile ile birleştirildiğinde 1,8 kat hızlanma elde edilir. Beraberindeki diffuse-compressor araç takımı, kullanıcıların kendi modellerini nicelemesine ve bunları normal Diffusers havuzları olarak yayınlamasına olanak tanır.
Kaynak: Hugging Face blog — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler