Nunchaku Lite apporte l'infusion de diffusion 4 bits à Diffusers
Hugging Face
Baidu
Nunchaku Lite, une nouvelle intégration dans Hugging Face Diffusers, permet de charger des modèles de diffusion quantifiés en 4 bits avec un simple appel from_pretrained(), sans pipelines personnalisés ni compilation CUDA locale. Il réduit la VRAM jusqu'à 50 % et accélère l'inférence d'environ 1,35 fois, avec des gains supplémentaires via torch.compile.
Nunchaku Lite est une nouvelle voie d'intégration dans Hugging Face Diffusers qui permet l'inférence en 4 bits pour les modèles de diffusion, basée sur la méthode de quantification SVDQuant derrière le moteur d'inférence populaire Nunchaku. Contrairement à la quantification standard uniquement des poids, SVDQuant exécute les couches principales du transformateur avec des poids et des activations en 4 bits (W4A4), réduisant ainsi la mémoire et accélérant la boucle de débruitage. Avec Nunchaku Lite, charger un checkpoint quantifié est aussi simple que d'appeler from_pretrained() sans nécessiter de compilation CUDA locale, grâce au package de kernels Hugging Face. Deux familles de kernels sont utilisées : svdq_w4a4 pour les projections d'attention et de MLP (disponibles en variantes INT4 et NVFP4) et awq_w4a16 pour les couches de normalisation. Les checkpoints NVFP4 nécessitent un GPU NVIDIA Blackwell (série RTX 50, RTX PRO 6000, B200), tandis que les variantes INT4 prennent en charge les GPU Turing/Ampere/Ada (séries RTX 30 et 40, A100, L40S). Les benchmarks sur un RTX PRO 6000 montrent une accélération de 1,35 fois et une réduction de la VRAM allant jusqu'à 50 % par rapport à la référence BF16 ; combiné avec torch.compile, on obtient une accélération de 1,8 fois. L'outil compagnon diffuse-compressor permet aux utilisateurs de quantifier leurs propres modèles et de les publier en tant que dépôts Diffusers standard.
Source: Hugging Face blog —
original
