заменяя nn.Linear модули диффузионной модели на специальные линейные слои с ядрами CUDA (svdq_w4a4 для основных вычислений и awq_w4a16 для слоёв нормализации). Чекпоинт загружается стандартным вызовом from_pretrained(), а конфигурация квантования хранится в config.json модели. Nunchaku Lite обеспечивает прирост скорости примерно 30% и снижение VRAM до 50% по сравнению с BF16. С torch.compile ускорение достигает 1.8x. Метод поддерживает GPU Blackwell (NVFP4) и Turing/Ampere/Ada (INT4). Для квантования собственных моделей предлагается инструментарий diffuse-compressor, который автоматически определяет цели квантования и упаковывает результат в формат Diffusers.