3 bits en lugar de 16: desglosando TurboQuant y cuándo activarlo realmente
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
El algoritmo TurboQuant de Google comprime la caché KV de los modelos de lenguaje de 5 a 6 veces sin reentrenamiento ni calibración, lo que ha causado pánico entre los fabricantes de memoria. A pesar del bombo sobre una 'aceleración de 8x' y 'cero pérdidas', el beneficio real es el ahorro de memoria, lo que permite contextos más largos en el mismo hardware. El artículo revisa cómo funciona, sus limitaciones y lo compara con alternativas como KVTC, RotorQuant y KIVI.
En marzo de 2026, Google publicó un artículo sobre TurboQuant, un algoritmo de compresión de memoria para modelos de lenguaje, que provocó un pánico en el mercado cuando las acciones de los fabricantes de memoria perdieron casi 90 mil millones de dólares en capitalización combinada en una semana. El algoritmo aborda el problema de la caché KV: a medida que los LLM generan texto, almacenan cálculos intermedios para todos los tokens anteriores, lo que crece linealmente con la longitud del contexto y puede consumir decenas de gigabytes. Por ejemplo, la caché KV para Llama 3.1 70B con un contexto de 128K ocupa alrededor de 40 GB en BF16, lo que hace imposible que quepa en una sola GPU H100. TurboQuant comprime la caché KV entre 5 y 6 veces aplicando una rotación aleatoria a los vectores antes de la cuantización, seguida de un cuantizador óptimo de Lloyd-Max, todo sin calibración ni ajuste fino. Este enfoque independiente de los datos funciona en cualquier modelo transformer. Google afirma 'hasta 8 veces de aceleración en GPUs H100', pero el análisis de la comunidad muestra que se mide en comparación con FP32; la aceleración real es de aproximadamente 4 veces solo para la atención, y el ahorro de memoria es el verdadero beneficio. Los puntos de referencia en modelos pequeños (hasta 8B) muestran una pérdida de precisión nula en LongBench y Needle-in-a-Haystack, pero no hay datos para modelos de 70B o más, y las pruebas de la comunidad en un modelo de 104B muestran solo un aumento de perplejidad del 3,6%. Las comparaciones con alternativas como KVTC (hasta 20 veces de compresión pero requiere calibración), RotorQuant (rotación más rápida pero menor calidad) y KIVI (16 veces de compresión, integrado en Hugging Face) proporcionan una imagen completa. La falta de código oficial se ve mitigada por más de 15 implementaciones de la comunidad.
Fuente: Habr — хаб ИИ —
original
