Nunchaku Lite: 4-битный инференс диффузионных моделей в Diffusers

Hugging FaceHugging Face BaiduBaidu
Nunchaku Lite — новая интеграция в Hugging Face Diffusers, позволяющая загружать 4-битные квантизированные диффузионные модели с помощью простого вызова from_pretrained() без необходимости создания пользовательских пайплайнов или локальной компиляции CUDA. Это снижает объем видеопамяти (VRAM) до 50% и ускоряет инференс примерно в 1,35 раза, с дополнительным приростом производительности при использовании torch.compile.
Nunchaku Lite — это новый путь интеграции в Hugging Face Diffusers, обеспечивающий 4-битный инференс для диффузионных моделей на основе метода квантования SVDQuant, лежащего в основе популярного инференс-движка Nunchaku. В отличие от стандартного квантования только весов, SVDQuant запускает основные слои трансформера с 4-битными весами и активациями (W4A4), что уменьшает объем памяти и ускоряет
Показать ещё ↓
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости