Nunchaku Lite brengt 4-bit diffusie-inferentie naar Diffusers
Hugging Face
Baidu
Nunchaku Lite, een nieuwe integratie in Hugging Face Diffusers, maakt het mogelijk om 4-bit gekwantiseerde diffusiemodellen te laden met een eenvoudige from_pretrained()-aanroep, zonder aangepaste pipelines of lokale CUDA-compilatie. Het vermindert het VRAM-gebruik met tot 50% en versnelt de inferentie met ongeveer 1,35x, met verdere winst via torch.compile.
Nunchaku Lite is een nieuw integratiepad in Hugging Face Diffusers dat 4-bit inferentie voor diffusiemodellen mogelijk maakt, gebaseerd op de SVDQuant-kwantiseringsmethode achter de populaire Nunchaku-inferentie-engine. In tegenstelling tot standaard gewicht-only kwantisering, verwerkt SVDQuant de belangrijkste transformatorlagen met 4-bit gewichten en activeringen (W4A4), wat geheugen bespaart en de denoising-loop versnelt. Met Nunchaku Lite is het laden van een gekwantiseerd checkpoint net zo eenvoudig als het aanroepen van from_pretrained(), zonder dat er lokale CUDA-compilatie nodig is, dankzij het Hugging Face kernels-pakket. Er worden twee kernel-families gebruikt: svdq_w4a4 voor attention- en MLP-projecties (beschikbaar in INT4- en NVFP4-varianten) en awq_w4a16 voor normalisatielagen. NVFP4-checkpoints vereisen een NVIDIA Blackwell GPU (RTX 50-serie, RTX PRO 6000, B200), terwijl INT4-varianten Turing/Ampere/Ada GPU's ondersteunen (RTX 30- en 40-serie, A100, L40S). Benchmarkresultaten op een RTX PRO 6000 laten een 1,35x snelheidswinst en tot 50% VRAM-reductie zien in vergelijking met de BF16-basislijn; in combinatie met torch.compile levert dit een 1,8x snelheidswinst op. De bijbehorende diffuse-compressor-toolkit stelt gebruikers in staat om hun eigen modellen te kwantiseren en te publiceren als reguliere Diffusers-repositories.
Bron: Hugging Face blog —
origineel
