Nunchaku Lite : inférence 4 bits des modèles de diffusion dans Diffusers
Nunchaku est une méthode de quantification SVDQuant (W4A4) pour les transformateurs de diffusion. La nouvelle intégration Nunchaku Lite permet de charger des points de contrôle quantifiés directement via from_pretrained() dans Diffusers, sans moteur séparé. La vitesse de génération augmente jusqu'à 1,8 fois, la consommation crête de VRAM diminue jusqu'à 50 %.
Hugging Face
Baidu
Hugging Face blog24.07 · 02:04
