Hardware & InferentieOpen Source 🇺🇸 24.07.2026 02:04

Nunchaku Lite: 4-bit Inference of Diffusion Models in Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku is a quantization method SVDQuant (W4A4) for diffusion transformers. The new Nunchaku Lite integration allows loading quantized checkpoints directly via from_pretrained() in Diffusers, without a separate engine. Generation speed increases up to 1.8x, peak VRAM consumption drops up to 50%.
В блоге Hugging Face анонсирована интеграция метода квантования Nunchaku (основан на SVDQuant) в библиотеку Diffusers. SVDQuant работает с 4-битными весами и активациями (W4A4) и обрабатывает выбросы за счёт перемещения их в веса, оставляя малую 16-битную низкоранговую ветвь. Оригинальный движок Nunchaku требовал отдельных интеграций под каждую архитектуру. Nunchaku Lite устраняет эту проблему, заменяя nn.Linear модули диффузионной модели на специальные линейные слои с ядрами CUDA (svdq_w4a4 для основных вычислений и awq_w4a16 для слоёв нормализации). Чекпоинт загружается стандартным вызовом from_pretrained(), а конфигурация квантования хранится в config.json модели. Nunchaku Lite обеспечивает прирост скорости примерно 30% и снижение VRAM до 50% по сравнению с BF16. С torch.compile ускорение достигает 1.8x. Метод поддерживает GPU Blackwell (NVFP4) и Turing/Ampere/Ada (INT4). Для квантования собственных моделей предлагается инструментарий diffuse-compressor, который автоматически определяет цели квантования и упаковывает результат в формат Diffusers.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws