Nunchaku Lite: 4-bit Inference of Diffusion Models in Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku is a quantization method SVDQuant (W4A4) for diffusion transformers. The new Nunchaku Lite integration allows loading quantized checkpoints directly via from_pretrained() in Diffusers, without a separate engine. Generation speed increases up to 1.8x, peak VRAM consumption drops up to 50%.
Hugging Faceのブログで、量子化手法Nunchaku(SVDQuantに基づく)のDiffusersライブラリへの統合が発表されました。SVDQuantは4ビットの重みとアクティベーション(W4A4)で動作し、外れ値を重みに移動することで処理し、小さな16ビットの低ランクブランチを残します。元のNunchakuエンジンはアーキテクチャごとに個別の統合が必要でした。Nunchaku Liteはこの問題を解決し、拡散モデルのnn.Linearモジュールを、CUDAカーネル(メイン計算用のsvdq_w4a4と正規化層用のawq_w4a16)を備えた特殊な線形層に置き換えます。チェックポイントは標準のfrom_pretrained()呼び出しで読み込まれ、量子化設定はモデルのconfig.jsonに保存されます。Nunchaku LiteはBF16と比較して約30%の速度向上と最大50%のVRAM削減を実現します。torch.compileを使用すると、高速化は1.8倍に達します。この手法はGPU Blackwell(NVFP4)およびTuring/Ampere/Ada(INT4)をサポートしています。独自モデルの量子化には、量子化ターゲットを自動的に特定し、結果をDiffusers形式にパッケージ化するツールキットdiffuse-compressorが提供されています。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース