RisetPerangkat Keras & Inferensi 🇷🇺 15.08.2026 11:02

3 Bit Alih-alih 16: Membongkar TurboQuant dan Kapan Sebaiknya Mengaktifkannya

Google/DeepMindGoogle/DeepMind MistralMistral Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen NVIDIANVIDIA
Algoritma TurboQuant dari Google mengompresi cache KV (KV-cache) model bahasa 5-6 kali lipat tanpa pelatihan ulang atau kalibrasi, yang menyebabkan kepanikan di kalangan produsen memori. Meskipun ada sensasi tentang 'percepatan 8 kali lipat' dan 'tanpa kehilangan', manfaat sebenarnya adalah penghematan memori, yang memungkinkan konteks lebih panjang pada perangkat keras yang sama. Artikel ini mengulas cara kerjanya, keterbatasannya, dan membandingkannya dengan alternatif seperti KVTC, RotorQuant, dan KIVI.
Pada bulan Maret 2026, Google menerbitkan sebuah tulisan tentang TurboQuant, sebuah algoritma kompresi memori untuk model bahasa, yang menyebabkan kepanikan pasar ketika saham produsen memori kehilangan hampir $90 miliar kapitalisasi gabungan dalam sepekan. Algoritma ini mengatasi masalah KV-cache: saat LLM menghasilkan teks, mereka menyimpan komputasi antara untuk semua token sebelumnya, yang tumbuh secara linear seiring panjang konteks dan dapat menghabiskan puluhan gigabyte. Misalnya, KV-cache untuk Llama 3.1 70B pada konteks 128K memakan sekitar 40 GB dalam BF16, membuatnya tidak mungkin muat pada satu GPU H100. TurboQuant mengompresi KV-cache 5-6x dengan menerapkan rotasi acak pada vektor sebelum kuantisasi, diikuti oleh kuantizer Lloyd-Max yang optimal, semuanya tanpa kalibrasi atau penyesuaian halus. Pendekatan yang tidak bergantung pada data ini bekerja pada model transformer apa pun. Google mengklaim 'percepatan hingga 8x pada GPU H100', tetapi analisis komunitas menunjukkan bahwa itu diukur terhadap FP32; percepatan nyata sekitar 4x untuk bagian attention saja, dan penghematan memori adalah manfaat sebenarnya. Tolok ukur pada model kecil (hingga 8B) menunjukkan tidak ada kehilangan akurasi pada LongBench dan Needle-in-a-Haystack, tetapi tidak ada data untuk model 70B+, dan uji komunitas pada model 104B hanya menunjukkan peningkatan perplexity sebesar 3,6%. Perbandingan dengan alternatif seperti KVTC (kompresi hingga 20x tetapi memerlukan kalibrasi), RotorQuant (rotasi lebih cepat tetapi kualitas lebih rendah), dan KIVI (kompresi 16x, terintegrasi ke dalam Hugging Face) memberikan gambaran yang komprehensif. Ketiadaan kode resmi diimbangi oleh lebih dari 15 implementasi komunitas.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru