3비트 대신 16비트: TurboQuant 분석 및 실제 활성화 시점
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
구글의 TurboQuant 알고리즘은 언어 모델의 KV-캐시를 재학습이나 캘리브레이션 없이 5~6배 압축하여 메모리 제조업체에 패닉을 일으켰습니다. '8배 속도 향상'과 '제로 손실'이라는 과대광고에도 불구하고, 실제 이점은 메모리 절약으로, 동일한 하드웨어에서 더 긴 컨텍스트를 지원할 수 있게 합니다. 이 기사는 작동 방식, 한계를 검토하고 KVTC, RotorQuant, KIVI와 같은 대안과 비교합니다.
2026년 3월, 구글은 언어 모델용 메모리 압축 알고리즘인 TurboQuant에 관한 게시물을 공개했는데, 이로 인해 메모리 제조사 주식이 일주일 만에 시가총액 합계 약 900억 달러를 잃으며 시장에 패닉이 발생했습니다. 이 알고리즘은 KV-캐시 문제를 해결합니다. LLM이 텍스트를 생성할 때 이전 모든 토큰에 대한 중간 계산을 저장하는데, 이는 컨텍스트 길이에 따라 선형적으로 증가하여 수십 기가바이트를 소비할 수 있습니다. 예를 들어, Llama 3.1 70B의 128K 컨텍스트에서 KV-캐시는 BF16에서 약 40GB를 차지하여 단일 H100 GPU에 맞추는 것이 불가능합니다. TurboQuant는 벡터에 무작위 회전을 적용한 후 양자화하고, 이어서 최적의 Lloyd-Max 양자화기를 적용하여 KV-캐시를 5~6배 압축하며, 보정이나 미세 조정이 필요 없습니다. 이 데이터 무관 방식은 모든 트랜스포머 모델에서 작동합니다. 구글은 'H100 GPU에서 최대 8배 속도 향상'을 주장하지만, 커뮤니티 분석에 따르면 이는 FP32 기준으로 측정된 것이며, 실제 속도 향상은 어텐션 전용으로 약 4배이고, 메모리 절약이 진정한 이점입니다. 소형 모델(최대 8B)에 대한 벤치마크에서는 LongBench와 Needle-in-a-Haystack에서 정확도 손실이 0으로 나타났지만, 70B 이상 모델에 대한 데이터는 없으며, 104B 모델에 대한 커뮤니티 테스트에서는 혼란도(perplexity)가 3.6%만 증가했습니다. KVTC(최대 20배 압축이지만 보정 필요), RotorQuant(더 빠른 회전이지만 품질 낮음), KIVI(16배 압축, Hugging Face에 통합)와 같은 대안과의 비교는 포괄적인 그림을 제공합니다. 공식 코드가 없음에도 불구하고 15개 이상의 커뮤니티 구현이 이를 보완합니다.
출처: Habr — хаб ИИ —
원문
