3 бита вместо 16: разбираем TurboQuant и когда его действительно стоит включать

Google/DeepMind Mistral Google DeepMind Alibaba/Qwen NVIDIA
Алгоритм TurboQuant от Google сжимает KV-кэш языковых моделей в 5-6 раз без дообучения или калибровки, что вызвало панику среди производителей памяти. Несмотря на ажиотаж вокруг «ускорения в 8 раз» и «нулевых потерь», реальная выгода — экономия памяти, позволяющая использовать более длинные контексты на том же оборудовании. В статье рассматривается, как он работает, его ограничения и сравнение с альтернативами, такими как KVTC, RotorQuant и KIVI.
В марте 2026 года Google опубликовал пост о TurboQuant, алгоритме сжатия памяти для языковых моделей, который вызвал панику на рынке: акции производителей памяти за неделю потеряли в совокупной капитализации почти 90 миллиардов долларов. Алгоритм решает проблему KV-кэша: при генерации текста LLM хранят промежуточные вычисления для всех предыдущих токенов, что растет линейно с длиной контекста и
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости