Hardware e InferenciaCódigo Abierto 🇺🇸 24.07.2026 02:04

Nunchaku Lite: Inferencia de modelos de difusión en 4 bits en Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku es un método de cuantización SVDQuant (W4A4) para transformers de difusión. La nueva integración Nunchaku Lite permite cargar puntos de control cuantizados directamente mediante from_pretrained() en Diffusers, sin un motor separado. La velocidad de generación aumenta hasta 1.8 veces, y el consumo máximo de VRAM se reduce hasta un 50%.
En el blog de Hugging Face se ha anunciado la integración del método de cuantización Nunchaku (basado en SVDQuant) en la biblioteca Diffusers. SVDQuant trabaja con pesos y activaciones de 4 bits (W4A4) y maneja los valores atípicos desplazándolos a los pesos, dejando una pequeña rama de bajo rango de 16 bits. El motor original de Nunchaku requería integraciones separadas para cada arquitectura. Nunchaku Lite resuelve este problema reemplazando los módulos nn.Linear del modelo de difusión por capas lineales especiales con núcleos CUDA (svdq_w4a4 para los cálculos principales y awq_w4a16 para las capas de normalización). El checkpoint se carga con la llamada estándar from_pretrained(), y la configuración de cuantización se almacena en el config.json del modelo. Nunchaku Lite proporciona un aumento de velocidad de aproximadamente el 30% y una reducción de VRAM de hasta el 50% en comparación con BF16. Con torch.compile, la aceleración alcanza 1.8x. El método admite GPU Blackwell (NVFP4) y Turing/Ampere/Ada (INT4). Para cuantizar modelos propios, se ofrece el conjunto de herramientas diffuse-compressor, que determina automáticamente los objetivos de cuantización y empaqueta el resultado en el formato Diffusers.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas