Diskreetti kvantisointi: neuroverkkojen pakkaamisen seuraava edistysaskel
PrismML
Artikkelissa tarkastellaan siirtymää klassisista kvantisointitekniikoista diskreettiin kvantisointiin, jossa painot rajoitetaan pieneen arvojoukkoon (binaarinen, kolmiarvoinen). Siinä korostetaan PrismML:n Bonsai 27B -malliperhettä, joka käyttää Qwen 3.6 27B -mallin binaarisia ja kolmiarvoisia versioita saavuttaen jopa 14-kertaisen pakkauksen säilyttäen samalla merkittävän osan alkuperäisen mallin ominaisuuksista. Kirjoittaja testaa kolmiarvoista versiota ja toteaa nopeamman päättelyn, mutta epätasaisia suorituskyvyn laskuja monimutkaisissa tehtävissä, ja pohtii käytännön vaikutuksia suurten mallien suorittamiseen kuluttajatason laitteistolla.
Artikkelin alussa käsitellään neuroverkkojen kvantisoinnin kehitystä perinteisistä liukulukumuodoista kokonaislukutyyppeihin, kuten INT8 ja INT4, ja edelleen diskreettiin kvantisointiin binääristen (1-bittisten) ja kolmitasoisilla (1,58-bittisten) painojen kanssa. Tämä lähestymistapa vähentää radikaalisti mallin kokoa ja mahdollistaa käytön kuluttajalaitteistossa. PrismML:n Bonsai 27B -perhe, joka perustuu Qwen 3.6 27B -malliin, tarjoaa binääriset ja kolmitasoiset versiot, jotka vievät 3,8 gigatavua ja 7,17 gigatavua verrattuna alkuperäisen mallin 53,8 gigatavuun. Yritys väittää säilyttävänsä jopa 90–95 prosenttia alkuperäisistä ominaisuuksista, mutta kirjoittajan testit osoittavat noin 75 prosentin tason matematiikassa ja koodauksessa sekä 60 prosentin tason monimutkaisissa monitoimijaisissa funktiokutsuissa, mikä on silti vaikuttavaa mallille, joka on 10 kertaa pienempi. Kirjoittaja huomauttaa, että kolmitasoinen malli ylittää alkuperäisen nopeudessa, tuottaen tekstiä nopeammin. Lisäksi mukana on spekulatiivinen luonnostelija DSpark, joka lisää tuotantonopeutta 35 prosenttia ilman laadun heikkenemistä. Malli vaatii kuitenkin erityisen llama.cpp-haarukan epästandardin kvantisointimuodon vuoksi, ja kirjoittaja näyttää, miten se rakennetaan ja ajetaan. Kirjoittaja päättää, että tämä edustaa merkittävää saavutusta, joka tarjoaa laadun, joka on verrattavissa suurempiin kvantisoituihin malleihin, mutta mahtuu pienempään näytön muistiin, mikä tekee siitä sopivan paikalliseen käyttöön ja mahdollisesti myös mobiililaitteisiin, kuten iPhone 17 Pro Maxiin.
Lähde: Habr — хаб ИИ —
Alkuperäinen
