3 bittiä 16:n sijaan: TurboQuantin purkaminen ja milloin se kannattaa ottaa käyttöön
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
Googlen TurboQuant-algoritmi pakkaa kielimallien KV-välimuistin 5-6 kertaa ilman uudelleenkoulutusta tai kalibrointia, mikä on aiheuttanut paniikkia muistivalmistajien keskuudessa. Huolimatta hehkutuksesta '8x nopeutuksesta' ja 'nollahäviöstä', todellinen hyöty on muistisäästöt, jotka mahdollistavat pidemmät kontekstit samalla laitteistolla. Artikkeli käy läpi, miten se toimii, sen rajoitukset ja vertailee sitä vaihtoehtoihin, kuten KVTC, RotorQuant ja KIVI.
Maaliskuussa 2026 Google julkaisi postauksen TurboQuantista, kielimallien muistinkompressioalgoritmista, mikä aiheutti markkinapaniikin, kun muistivalmistajien osakkeet menettivät viikossa yhteensä lähes 90 miljardia dollaria markkina-arvostaan. Algoritmi ratkaisee KV-välimuistin ongelman: kun LLM:t tuottavat tekstiä, ne tallentavat välilaskennat kaikille aiemmille tokeneille, mikä kasvaa lineaarisesti kontekstin pituuden kanssa ja voi viedä kymmeniä gigatavuja. Esimerkiksi Llama 3.1 70B:n KV-välimuisti 128K kontekstissa vie noin 40 Gt BF16-muodossa, joten se ei mahdu yhdelle H100-GPU:lle. TurboQuant pakkaa KV-välimuistin 5-6-kertaisesti soveltamalla satunnaisrotaatiota vektoreihin ennen kvantisointia, minkä jälkeen käytetään optimaalista Lloyd-Max-kvantisointia, kaikki ilman kalibrointia tai hienosäätöä. Tämä data-agnostinen lähestymistapa toimii missä tahansa transformeri-mallissa. Google väittää 'jopa 8-kertaista nopeutusta H100-GPU:illa', mutta yhteisön analyysi osoittaa, että se on mitattu FP32:ta vastaan; todellinen nopeutus on noin 4-kertainen vain attention-kerroksille, ja muistin säästö on todellinen hyöty. Vertailut pienillä malleilla (enintään 8B) osoittavat nollatarkkuushäviön LongBench- ja Needle-in-a-Haystack-testeissä, mutta 70B+ malleista ei ole dataa, ja yhteisön testit 104B-mallilla osoittavat vain 3,6 %:n perplexity-kasvun. Vertailut vaihtoehtoihin, kuten KVTC (jopa 20-kertainen pakkaus mutta vaatii kalibrointia), RotorQuant (nopeampi rotaatio mutta heikompi laatu) ja KIVI (16-kertainen pakkaus, integroitu Hugging Faceen), antavat kattavan kuvan. Virallisen koodin puute on lievitetty yli 15 yhteisön toteutuksella.
Lähde: Habr — хаб ИИ —
Alkuperäinen
