用3位代替16位:解析TurboQuant及其实际启用时机
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
谷歌的TurboQuant算法无需重新训练或校准即可将语言模型的KV缓存压缩5-6倍,引发了内存制造商的恐慌。尽管有'8倍加速'和'零损失'的炒作,但真正的好处是节省内存,从而在相同硬件上支持更长的上下文。文章回顾了其工作原理、局限性,并与KVTC、RotorQuant和KIVI等替代方案进行了比较。
2026年3月,谷歌发布了一篇关于TurboQuant的博文,这是一种用于语言模型的内存压缩算法,该算法导致市场恐慌,内存制造商股票在一周内市值合计蒸发近900亿美元。该算法解决了KV缓存问题:随着LLM生成文本,它们会存储所有先前令牌的中间计算,这会随上下文长度线性增长,并可能消耗数十GB空间。例如,在128K上下文下,Llama 3.1 70B的KV缓存占用约40GB(BF16格式),使其无法在单个H100 GPU上容纳。TurboQuant通过在对向量进行量化之前应用随机旋转,随后使用最优的Lloyd-Max量化器,将KV缓存压缩5-6倍,且无需校准或微调。这种数据无关的方法适用于任何Transformer模型。谷歌声称“在H100 GPU上加速高达8倍”,但社区分析表明,这是相对于FP32而言的;仅注意力机制的实际加速约为4倍,而内存节省才是真正的优势。在小型模型(最高8B)上的基准测试显示,在LongBench和Needle-in-a-Haystack上零精度损失,但没有70B以上模型的数据,社区对104B模型的测试显示困惑度仅增加3.6%。与替代方案的比较,如KVTC(最高20倍压缩,但需要校准)、RotorQuant(旋转更快但质量较低)和KIVI(16倍压缩,已集成到Hugging Face中),提供了全面的图景。官方代码的缺失已被超过15个社区实现所弥补。
来源: Habr — хаб ИИ —
原文
