Nunchaku Lite permite inferencia de difusión de 4 bits en Diffusers
Nunchaku Lite, una nueva integración en Hugging Face Diffusers, permite cargar modelos de difusión cuantizados a 4 bits con una simple llamada from_pretrained(), sin necesidad de pipelines personalizados ni compilación local de CUDA. Reduce el uso de VRAM hasta un 50% y acelera la inferencia aproximadamente 1.35 veces, con mejoras adicionales mediante torch.compile.
Hugging Face
Baidu
