Phần cứng & Suy luậnMã nguồn mở 🇺🇸 24.07.2026 02:04

Nunchaku Lite mang khả năng suy luận khuếch tán 4-bit đến Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite, một tích hợp mới trong Hugging Face Diffusers, cho phép tải các mô hình khuếch tán lượng tử hóa 4-bit chỉ với một lệnh gọi from_pretrained() đơn giản, mà không cần pipeline tùy chỉnh hay biên dịch CUDA cục bộ. Nó giảm VRAM tới 50% và tăng tốc suy luận khoảng 1.35 lần, cùng với các cải thiện bổ sung thông qua torch.compile.
Nunchaku Lite là một đường dẫn tích hợp mới trong Hugging Face Diffusers, mang đến khả năng suy luận 4-bit cho các mô hình khuếch tán, dựa trên phương pháp lượng tử hóa SVDQuant đứng sau công cụ suy luận phổ biến Nunchaku. Không giống như lượng tử hóa chỉ trọng số thông thường, SVDQuant chạy các lớp transformer chính với trọng số và kích hoạt 4-bit (W4A4), giảm bộ nhớ và tăng tốc vòng lặp khử nhiễu. Với Nunchaku Lite, việc tải một điểm kiểm tra đã lượng tử hóa đơn giản như gọi from_pretrained() mà không cần biên dịch CUDA cục bộ, nhờ gói kernels của Hugging Face. Hai họ kernel được sử dụng: svdq_w4a4 cho các phép chiếu attention và MLP (có biến thể INT4 và NVFP4) và awq_w4a16 cho các lớp chuẩn hóa. Các điểm kiểm tra NVFP4 yêu cầu GPU NVIDIA Blackwell (dòng RTX 50, RTX PRO 6000, B200), trong khi biến thể INT4 hỗ trợ GPU Turing/Ampere/Ada (dòng RTX 30 & 40, A100, L40S). Các điểm chuẩn trên RTX PRO 6000 cho thấy tốc độ tăng 1,35 lần và giảm VRAM lên đến 50% so với đường cơ sở BF16; kết hợp với torch.compile đạt tốc độ tăng 1,8 lần. Bộ công cụ diffuse-compressor đi kèm cho phép người dùng lượng tử hóa mô hình của riêng họ và xuất bản chúng dưới dạng kho lưu trữ Diffusers thông thường.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới