PesquisaHardware e Inferência 🇷🇺 15.08.2026 11:02

3 Bits em Vez de 16: Entendendo o TurboQuant e Quando Realmente Ativá-lo

Google/DeepMindGoogle/DeepMind MistralMistral Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen NVIDIANVIDIA
O algoritmo TurboQuant do Google comprime o cache KV de modelos de linguagem de 5 a 6 vezes sem retreinamento ou calibração, causando pânico entre fabricantes de memória. Apesar do hype sobre 'aceleração de 8x' e 'perda zero', o benefício real é a economia de memória, permitindo contextos mais longos no mesmo hardware. O artigo revisa como funciona, suas limitações e compara com alternativas como KVTC, RotorQuant e KIVI.
Em março de 2026, o Google publicou um post sobre o TurboQuant, um algoritmo de compressão de memória para modelos de linguagem, que causou pânico no mercado, pois as ações de fabricantes de memória perderam quase US$ 90 bilhões em capitalização combinada em uma semana. O algoritmo aborda o problema do cache KV: à medida que os LLMs geram texto, eles armazenam cálculos intermediários para todos os tokens anteriores, o que cresce linearmente com o comprimento do contexto e pode consumir dezenas de gigabytes. Por exemplo, o cache KV para o Llama 3.1 70B com contexto de 128K ocupa cerca de 40 GB em BF16, tornando impossível caber em uma única GPU H100. O TurboQuant comprime o cache KV de 5 a 6 vezes, aplicando uma rotação aleatória aos vetores antes da quantização, seguida por um quantizador ótimo de Lloyd-Max, tudo sem calibração ou ajuste fino. Essa abordagem independente de dados funciona em qualquer modelo transformer. O Google afirma 'aceleração de até 8x em GPUs H100', mas a análise da comunidade mostra que isso é medido em comparação com FP32; a aceleração real é de cerca de 4x apenas para atenção, e a economia de memória é o verdadeiro benefício. Benchmarks em modelos pequenos (até 8B) mostram perda de precisão zero em LongBench e Needle-in-a-Haystack, mas não há dados para modelos de 70B+, e testes da comunidade em um modelo de 104B mostram apenas um aumento de perplexidade de 3,6%. Comparações com alternativas como KVTC (compressão de até 20x, mas requer calibração), RotorQuant (rotação mais rápida, mas qualidade inferior) e KIVI (compressão de 16x, integrada ao Hugging Face) fornecem um quadro abrangente. A falta de código oficial é mitigada por mais de 15 implementações da comunidade.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas