Hardware e InferênciaCódigo Aberto 🇺🇸 24.07.2026 02:04

Nunchaku Lite: Inferência de 4 bits de Modelos de Difusão no Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku é um método de quantização SVDQuant (W4A4) para transformers de difusão. A nova integração Nunchaku Lite permite carregar checkpoints quantizados diretamente via from_pretrained() no Diffusers, sem um mecanismo separado. A velocidade de geração aumenta em até 1,8x e o consumo máximo de VRAM cai em até 50%.
В блоге Hugging Face анонсирована интеграция метода квантования Nunchaku (основан на SVDQuant) в библиотеку Diffusers. SVDQuant работает с 4-битными весами и активациями (W4A4) и обрабатывает выбросы за счёт перемещения их в веса, оставляя малую 16-битную низкоранговую ветвь. Оригинальный движок Nunchaku требовал отдельных интеграций под каждую архитектуру. Nunchaku Lite устраняет эту проблему, заменяя nn.Linear модули диффузионной модели на специальные линейные слои с ядрами CUDA (svdq_w4a4 для основных вычислений и awq_w4a16 для слоёв нормализации). Чекпоинт загружается стандартным вызовом from_pretrained(), а конфигурация квантования хранится в config.json модели. Nunchaku Lite обеспечивает прирост скорости примерно 30% и снижение VRAM до 50% по сравнению с BF16. С torch.compile ускорение достигает 1.8x. Метод поддерживает GPU Blackwell (NVFP4) и Turing/Ampere/Ada (INT4). Для квантования собственных моделей предлагается инструментарий diffuse-compressor, который автоматически определяет цели квантования и упаковывает результат в формат Diffusers.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas