Nunchaku LiteがDiffusersに4ビット拡散推論をもたらす
Hugging Face
Baidu
Nunchaku LiteはHugging Face Diffusersへの新たな統合により、カスタムパイプラインやローカルCUDAコンパイルなしに、from_pretrained()呼び出しだけで4ビット量子化拡散モデルをロード可能にします。VRAMを最大50%削減し、推論速度を約1.35倍向上させ、torch.compileによりさらなる高速化も実現します。
Nunchaku Liteは、Hugging Face Diffusersにおける新たな統合パスであり、人気のNunchaku推論エンジンの背後にあるSVDQuant量子化手法に基づき、拡散モデルの4ビット推論を実現します。標準的な重みのみの量子化とは異なり、SVDQuantはメインのトランスフォーマー層を4ビットの重みとアクティベーション(W4A4)で実行し、メモリを削減してノイズ除去ループを高速化します。Nunchaku Liteでは、量子化チェックポイントの読み込みがfrom_pretrained()を呼び出すだけで簡単に行え、ローカルでのCUDAコンパイルは不要です。これはHugging Faceカーネルパッケージのおかげです。2つのカーネルファミリーが使用されています。アテンションとMLP射影用のsvdq_w4a4(INT4およびNVFP4バリアントが利用可能)と、正規化層用のawq_w4a16です。NVFP4チェックポイントにはNVIDIA Blackwell GPU(RTX 50シリーズ、RTX PRO 6000、B200)が必要で、INT4バリアントはTuring/Ampere/Ada GPU(RTX 30 & 40シリーズ、A100、L40S)をサポートします。RTX PRO 6000でのベンチマークでは、BF16ベースラインと比較して1.35倍の高速化と最大50%のVRAM削減を示し、torch.compileと組み合わせると1.8倍の高速化を実現します。付属のdiffuse-compressorツールキットにより、ユーザーは自身のモデルを量子化し、通常のDiffusersリポジトリとして公開することができます。
出典: Hugging Face blog —
原文
