RechercheMatériel et Inférence 🇷🇺 15.08.2026 11:02

3 bits au lieu de 16 : décryptage de TurboQuant et quand l'activer réellement

Google/DeepMindGoogle/DeepMind MistralMistral Google DeepMindGoogle DeepMind Alibaba/QwenAlibaba/Qwen NVIDIANVIDIA
L'algorithme TurboQuant de Google comprime le cache KV des modèles de langage de 5 à 6 fois sans réentraînement ni calibrage, provoquant la panique chez les fabricants de mémoires. Malgré le battage médiatique autour d'une 'accélération de 8x' et d'une 'perte nulle', le réel avantage réside dans les économies de mémoire, permettant des contextes plus longs sur le même matériel. Cet article examine son fonctionnement, ses limites et le compare à des alternatives comme KVTC, RotorQuant et KIVI.
En mars 2026, Google a publié un article sur TurboQuant, un algorithme de compression mémoire pour modèles de langue, qui a provoqué une panique sur les marchés, les actions des fabricants de mémoire ayant perdu près de 90 milliards de dollars de capitalisation combinée en une semaine. L'algorithme résout le problème du cache KV : lors de la génération de texte par les LLM, ils stockent des calculs intermédiaires pour tous les jetons précédents, ce qui croît linéairement avec la longueur du contexte et peut consommer des dizaines de gigaoctets. Par exemple, le cache KV pour Llama 3.1 70B avec un contexte de 128K occupe environ 40 Go en BF16, ce qui rend impossible de le faire tenir sur un seul GPU H100. TurboQuant compresse le cache KV de 5 à 6 fois en appliquant une rotation aléatoire aux vecteurs avant quantification, suivie d'un quantificateur optimal de Lloyd-Max, le tout sans calibrage ni ajustement. Cette approche indépendante des données fonctionne sur tout modèle transformer. Google revendique « jusqu'à 8 fois d'accélération sur les GPU H100 », mais l'analyse de la communauté montre que cela est mesuré par rapport au FP32 ; l'accélération réelle est d'environ 4 fois pour l'attention seule, et les économies de mémoire sont le véritable avantage. Les benchmarks sur de petits modèles (jusqu'à 8B) montrent une perte de précision nulle sur LongBench et Needle-in-a-Haystack, mais aucune donnée pour les modèles de 70B et plus, et les tests communautaires sur un modèle de 104B montrent seulement une augmentation de perplexité de 3,6 %. Les comparaisons avec des alternatives comme KVTC (jusqu'à 20 fois de compression mais nécessite un calibrage), RotorQuant (rotation plus rapide mais qualité inférieure) et KIVI (16 fois de compression, intégré à Hugging Face) fournissent une image complète. L'absence de code officiel est compensée par plus de 15 implémentations communautaires.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches