Laitteisto ja päättelyAvoin lähdekoodi 🇺🇸 24.07.2026 02:04

Nunchaku Lite: 4-bittinen päättely diffuusiomalleille Diffusers-kirjastossa

Hugging FaceHugging Face BaiduBaidu
Nunchaku on SVDQuant (W4A4) -kvantisointimenetelmä diffuusiotransformereille. Uusi Nunchaku Lite -integraatio mahdollistaa kvantisoitujen tarkistuspisteiden lataamisen suoraan from_pretrained()-metodilla Diffusers-kirjastossa ilman erillistä moottoria. Generointinopeus kasvaa jopa 1,8-kertaiseksi ja huippu VRAM-kulutus laskee jopa 50 prosenttia.
Hugging Facen blogissa ilmoitettiin Nunchaku-kvantisointimenetelmän (SVDQuant-pohjainen) integroinnista Diffusers-kirjastoon. SVDQuant toimii 4-bittisillä painoilla ja aktivaatioilla (W4A4) ja käsittelee poikkeamia siirtämällä ne painoihin, jättäen pienen 16-bittisen matalarankaisen haaran. Alkuperäinen Nunchaku-moottori vaati erilliset integraatiot jokaiselle arkkitehtuurille. Nunchaku Lite ratkaisee tämän ongelman korvaamalla diffuusiomallin nn.Linear-moduulit erityisillä lineaarisilla kerroksilla, joissa on CUDA-ytimet (svdq_w4a4 pääasiallisiin laskutoimituksiin ja awq_w4a16 normalisointikerroksiin). Tarkistuspiste ladataan tavallisella from_pretrained()-kutsulla, ja kvantisointikonfiguraatio tallennetaan mallin config.json-tiedostoon. Nunchaku Lite tarjoaa noin 30 prosentin nopeuslisäyksen ja jopa 50 prosentin VRAM-vähennyksen verrattuna BF16:een. Torch.compilella nopeutus saavuttaa 1,8-kertaisen. Menetelmä tukee Blackwell (NVFP4)- sekä Turing/Ampere/Ada (INT4) -näytönohjaimia. Omien mallien kvantisointiin tarjotaan diffuse-compressor-työkalu, joka määrittää automaattisesti kvantisointikohteet ja pakkaa tuloksen Diffusers-muotoon.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset