Nunchaku Lite: Inferência de 4 bits de Modelos de Difusão no Diffusers
Nunchaku é um método de quantização SVDQuant (W4A4) para transformers de difusão. A nova integração Nunchaku Lite permite carregar checkpoints quantizados diretamente via from_pretrained() no Diffusers, sem um mecanismo separado. A velocidade de geração aumenta em até 1,8x e o consumo máximo de VRAM cai em até 50%.
Hugging Face
Baidu
Hugging Face blog24.07 · 02:04
