硬件与推理开源 🇺🇸 24.07.2026 02:04

Nunchaku Lite 为 Diffusers 带来4位扩散推理

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite 是 Hugging Face Diffusers 中的一个新集成,允许通过简单的 from_pretrained() 调用加载4位量化扩散模型,无需自定义流水线或本地 CUDA 编译。它将显存占用降低多达50%,推理速度提升约1.35倍,并通过 torch.compile 可进一步优化。
Nunchaku Lite 是 Hugging Face Diffusers 中的一个新集成路径,基于流行推理引擎 Nunchaku 背后的 SVDQuant 量化方法,为扩散模型带来了 4 位推理。与标准的仅权重量化不同,SVDQuant 以 4 位权重和激活(即 W4A4)运行主要 Transformer 层,从而减少内存并加速去噪循环。借助 Nunchaku Lite,加载量化检查点就像调用 from_pretrained() 一样简单,无需本地 CUDA 编译,这得益于 Hugging Face kernels 包。使用了两种内核系列:针对注意力机制和 MLP 投影的 svdq_w4a4(提供 INT4 和 NVFP4 变体)以及针对归一化层的 awq_w4a16。NVFP4 检查点需要 NVIDIA Blackwell GPU(即 RTX 50 系列、RTX PRO 6000、B200),而 INT4 变体支持 Turing/Ampere/Ada GPU(即 RTX 30 和 40 系列、A100、L40S)。在 RTX PRO 6000 上的基准测试显示,与 BF16 基线相比,速度提升 1.35 倍,显存减少高达 50%;结合 torch.compile 可实现 1.8 倍加速。配套的 diffuse-compressor 工具包允许用户量化自己的模型,并将其发布为常规的 Diffusers 仓库。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻