Matériel et Inférence RSS

Nunchaku Lite : inférence 4 bits des modèles de diffusion dans Diffusers

Nunchaku est une méthode de quantification SVDQuant (W4A4) pour les transformateurs de diffusion. La nouvelle intégration Nunchaku Lite permet de charger des points de contrôle quantifiés directement via from_pretrained() dans Diffusers, sans moteur séparé. La vitesse de génération augmente jusqu'à 1,8 fois, la consommation crête de VRAM diminue jusqu'à 50 %.

Hugging FaceHugging Face BaiduBaidu
Hugging Face blog24.07 · 02:04
Infos fraîches