Nunchaku Lite tuo 4-bittisen diffuusiopäätelyn Diffusers-kirjastoon
Hugging Face
Baidu
Nunchaku Lite, uusi integraatio Hugging Face Diffusers -kirjastossa, mahdollistaa 4-bittisten kvantisoitujen diffuusiomallien lataamisen yksinkertaisella from_pretrained()-kutsulla ilman omia putkistoja tai paikallista CUDA-kääntämistä. Se vähentää VRAM-käyttöä jopa 50 prosenttia ja nopeuttaa päättelyä noin 1,35-kertaisesti, ja lisäparannuksia saavutetaan torch.compile-komennolla.
Nunchaku Lite on uusi integraatiopolku Hugging Face Diffusers -kirjastossa, joka tuo 4-bittisen päättelyn diffuusiomalleille perustuen SVDQuant-kvantointimenetelmään, joka on suositun Nunchaku-päättelymoottorin taustalla. Toisin kuin tavallinen painoarvojen kvantointi, SVDQuant ajaa päätmuuntajakerrokset 4-bittisillä painoilla ja aktivaatioilla (W4A4), mikä vähentää muistinkäyttöä ja nopeuttaa kohinanpoistosilmukkaa. Nunchaku Liten avulla kvantoidun tarkistuspisteen lataaminen on yhtä helppoa kuin from_pretrained()-funktion kutsuminen ilman paikallista CUDA-käännöstä, kiitos Hugging Face kernels -paketin. Käytössä on kaksi kernelperhettä: svdq_w4a4 huomio- ja MLP-projektioille (saatavana INT4- ja NVFP4-muunnoksina) ja awq_w4a16 normalisointikerroksille. NVFP4-tarkistuspisteet vaativat NVIDIA Blackwell -näytönohjaimen (RTX 50 -sarja, RTX PRO 6000, B200), kun taas INT4-muunnokset tukevat Turing/Ampere/Ada-näytönohjaimia (RTX 30 ja 40 -sarja, A100, L40S). Vertailussa RTX PRO 6000 -näytönohjaimella saavutetaan 1,35-kertainen nopeutus ja jopa 50 prosentin VRAM-vähennys verrattuna BF16-perustasoon; yhdistämällä torch.compileen saavutetaan 1,8-kertainen nopeutus. Mukana tuleva diffuse-compressor-työkalupakki antaa käyttäjille mahdollisuuden kvantoida omia mallejaan ja julkaista ne tavallisina Diffusers-säilöinä.
Lähde: Hugging Face blog —
Alkuperäinen
