Hardware e InferenciaCódigo Abierto 🇺🇸 24.07.2026 02:04

Nunchaku Lite permite inferencia de difusión de 4 bits en Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite, una nueva integración en Hugging Face Diffusers, permite cargar modelos de difusión cuantizados a 4 bits con una simple llamada from_pretrained(), sin necesidad de pipelines personalizados ni compilación local de CUDA. Reduce el uso de VRAM hasta un 50% y acelera la inferencia aproximadamente 1.35 veces, con mejoras adicionales mediante torch.compile.
Nunchaku Lite es una nueva vía de integración en Hugging Face Diffusers que permite inferencia con 4 bits para modelos de difusión, basada en el método de cuantización SVDQuant que impulsa el popular motor de inferencia Nunchaku. A diferencia de la cuantización estándar solo de pesos, SVDQuant ejecuta las capas principales del transformador con pesos y activaciones de 4 bits (W4A4), reduciendo la memoria y acelerando el bucle de eliminación de ruido. Con Nunchaku Lite, cargar un punto de control cuantizado es tan sencillo como llamar a from_pretrained() sin necesidad de compilación CUDA local, gracias al paquete de kernels de Hugging Face. Se utilizan dos familias de kernels: svdq_w4a4 para las proyecciones de atención y MLP (disponibles en variantes INT4 y NVFP4) y awq_w4a16 para las capas de normalización. Los puntos de control NVFP4 requieren una GPU NVIDIA Blackwell (serie RTX 50, RTX PRO 6000, B200), mientras que las variantes INT4 son compatibles con GPUs Turing/Ampere/Ada (series RTX 30 y 40, A100, L40S). Los benchmarks en una RTX PRO 6000 muestran una aceleración de 1.35x y una reducción de VRAM de hasta un 50% en comparación con la línea base BF16; combinado con torch.compile se logra una aceleración de 1.8x. El kit de herramientas complementario diffuse-compressor permite a los usuarios cuantizar sus propios modelos y publicarlos como repositorios regulares de Diffusers.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas