может занимать десятки гигабайт. Например, KV-кэш для Llama 3.1 70B при контексте 128K занимает около 40 ГБ в BF16, что делает невозможным его размещение на одном GPU H100. TurboQuant сжимает KV-кэш в 5–6 раз, применяя случайное вращение к векторам перед квантованием с последующим оптимальным квантователем Ллойда–Макса, и всё это без калибровки или дообучения. Такой подход, не зависящий от данных, работает с любой трансформерной моделью. Google утверждает «ускорение до 8 раз на GPU H100», но анализ сообщества показывает, что это сравнение с FP32; реальное ускорение составляет около 4 раз только для внимания, а истинная выгода — в экономии памяти. Бенчмарки на небольших моделях (до 8B) показывают нулевую потерю точности на LongBench и Needle-in-a-Haystack, но данных для моделей свыше 70B нет, а тесты сообщества на модели 104B показывают лишь рост перплексии на 3,6%. Сравнение с альтернативами, такими как KVTC (сжатие до 20 раз, но требует калибровки), RotorQuant (более быстрое вращение, но ниже качество) и KIVI (сжатие в 16 раз, интегрирован в Hugging Face), дает полную картину. Отсутствие официального кода компенсируется более чем 15 реализациями сообщества.