硬件与推理 RSS

硬件与推理 🇺🇸

Nunchaku Lite 为 Diffusers 带来4位扩散推理

Nunchaku Lite 是 Hugging Face Diffusers 中的一个新集成,允许通过简单的 from_pretrained() 调用加载4位量化扩散模型,无需自定义流水线或本地 CUDA 编译。它将显存占用降低多达50%,推理速度提升约1.35倍,并通过 torch.compile 可进一步优化。

Hugging FaceHugging Face BaiduBaidu
Hugging Face blog24.07 · 02:04
最新新闻