研究ハードウェア・推論 🇷🇺 15.08.2026 11:02

3比特代替16比特:解析TurboQuant及实际启用时机

Google/DeepMindGoogle/DeepMind MistralMistral Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen NVIDIANVIDIA
谷歌的TurboQuant算法无需再训练或校准即可将语言模型的键值缓存压缩5至6倍,引发了内存制造商的恐慌。尽管有“8倍加速”和“零损失”的宣传,但真正的好处是节省内存,使得在同一硬件上支持更长的上下文。文章回顾了其工作原理、局限性,并与KVTC、RotorQuant和KIVI等替代方案进行了比较。
2026年3月、Googleは言語モデル用メモリ圧縮アルゴリズムであるTurboQuantに関する投稿を公開し、メモリメーカーの株価が1週間で合計時価総額約900億ドルを失う市場パニックを引き起こしました。このアルゴリズムはKVキャッシュ問題に対処します。LLMがテキストを生成する際、以前のすべてのトークンに対する中間計算を保存し、これはコンテキスト長に比例して増加し、数十ギガバイトを消費する可能性があります。例えば、Llama 3.1 70Bの128KコンテキストにおけるKVキャッシュはBF16で約40GBを占め、単一のH100 GPUに収めることは不可能です。TurboQuantは、量子化前にベクトルにランダム回転を適用し、その後最適なLloyd-Max量子化器を使用することで、KVキャッシュを5〜6倍圧縮します。これらはすべてキャリブレーションやファインチューニングなしで行われます。このデータ非依存のアプローチは、あらゆるトランスフォーマーモデルで機能します。Googleは「H100 GPUで最大8倍の高速化」を主張していますが、コミュニティの分析によると、これはFP32と比較したものであり、実際の高速化はアテンションのみで約4倍であり、メモリ節約が真の利点です。小規模モデル(最大8B)でのベンチマークでは、LongBenchとNeedle-in-a-Haystackで精度損失ゼロを示していますが、70B以上のモデルでのデータはなく、コミュニティによる104Bモデルのテストでは、パープレキシティが3.6%増加しただけでした。KVTC(最大20倍の圧縮だがキャリブレーションが必要)、RotorQuant(回転は高速だが品質が低い)、KIVI(16倍圧縮、Hugging Faceに統合)などの代替案との比較は、包括的な全体像を提供します。公式コードの不足は、15以上のコミュニティ実装によって補われています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース