Nunchaku Lite traz inferência de difusão de 4 bits para Diffusers
Hugging Face
Baidu
Nunchaku Lite, uma nova integração no Hugging Face Diffusers, permite carregar modelos de difusão quantizados em 4 bits com uma simples chamada from_pretrained(), sem pipelines personalizados ou compilação CUDA local. Reduz o VRAM em até 50% e acelera a inferência em cerca de 1,35 vez, com ganhos adicionais via torch.compile.
Nunchaku Lite é um novo caminho de integração no Hugging Face Diffusers que traz inferência de 4 bits para modelos de difusão, baseado no método de quantização SVDQuant por trás do popular mecanismo de inferência Nunchaku. Diferentemente da quantização padrão somente de pesos, o SVDQuant executa as principais camadas do transformer com pesos e ativações de 4 bits (W4A4), reduzindo a memória e acelerando o loop de remoção de ruído. Com o Nunchaku Lite, carregar um checkpoint quantizado é tão simples quanto chamar from_pretrained(), sem necessidade de compilação local de CUDA, graças ao pacote de kernels do Hugging Face. Duas famílias de kernels são utilizadas: svdq_w4a4 para projeções de atenção e MLP (disponíveis nas variantes INT4 e NVFP4) e awq_w4a16 para camadas de normalização. Checkpoints NVFP4 exigem uma GPU NVIDIA Blackwell (série RTX 50, RTX PRO 6000, B200), enquanto variantes INT4 suportam GPUs Turing/Ampere/Ada (séries RTX 30 e 40, A100, L40S). Benchmarks em uma RTX PRO 6000 mostram um aumento de velocidade de 1,35x e redução de até 50% de VRAM em comparação com a linha de base BF16; combinando com torch.compile, obtém-se um ganho de 1,8x. O conjunto de ferramentas complementar diffuse-compressor permite que os usuários quantizem seus próprios modelos e os publiquem como repositórios regulares do Diffusers.
Fonte: Hugging Face blog —
original
