3 bit thay vì 16: Phân tích TurboQuant và khi nào nên thực sự bật nó
Google/DeepMind
Mistral
Google DeepMind
Alibaba/Qwen
NVIDIA
Thuật toán TurboQuant của Google nén bộ nhớ cache KV của mô hình ngôn ngữ 5-6 lần mà không cần huấn luyện lại hoặc hiệu chuẩn, gây hoảng loạn cho các nhà sản xuất bộ nhớ. Mặc dù có quảng cáo về 'tăng tốc 8 lần' và 'không mất mát', lợi ích thực sự là tiết kiệm bộ nhớ, cho phép ngữ cảnh dài hơn trên cùng phần cứng. Bài viết xem xét cách nó hoạt động, hạn chế và so sánh với các phương pháp thay thế kvới KVTC, RotorQuant và KIVI.
Vào tháng 3 năm 2026, Google đã công bố một bài đăng về TurboQuant, một thuật toán nén bộ nhớ dành cho các mô hình ngôn ngữ lớn (LLMs), gây ra sự hoảng loạn trên thị trường khi cổ phiếu của các nhà sản xuất bộ nhớ mất gần 90 tỷ đô la vốn hóa chung trong một tuần. Thuật toán này giải quyết vấn đề bộ nhớ KV-cache: khi các mô hình ngôn ngữ lớn (LLMs) tạo văn bản, chúng lưu trữ các phép tính trung gian cho tất cả các token trước đó, lượng dữ liệu này tăng tuyến tính theo độ dài ngữ cảnh và có thể tiêu thụ hàng chục gigabyte. Ví dụ, bộ nhớ KV-cache của Llama 3.1 70B ở độ dài ngữ cảnh 128K chiếm khoảng 40 GB ở định dạng BF16, khiến không thể lưu vừa trên một GPU H100 duy nhất. TurboQuant nén bộ nhớ KV-cache với tỷ lệ 5-6 lần bằng cách áp dụng phép xoay ngẫu nhiên lên các vector trước khi lượng tử hóa, sau đó sử dụng bộ lượng tử hóa Lloyd-Max tối ưu, tất cả đều không cần hiệu chỉnh (calibration) hay tinh chỉnh (fine-tuning). Phương pháp không phụ thuộc dữ liệu này hoạt động trên mọi mô hình biến đổi (transformer). Google cho biết “tăng tốc lên đến 8 lần trên GPU H100”, nhưng phân tích từ cộng đồng chỉ ra mức tăng tốc này được đo so với chuẩn FP32; tốc độ thực tế chỉ khoảng 4 lần khi tính toán phần attention, và tiết kiệm bộ nhớ mới là lợi ích thực sự. Các bài kiểm tra hiệu năng trên các mô hình nhỏ (lên đến 8B) cho thấy không có sụt giảm độ chính xác trên các bộ đánh giá LongBench và Needle-in-a-Haystack, nhưng chưa có dữ liệu cho các mô hình từ 70B trở lên, đồng thời các bài kiểm tra từ cộng đồng trên mô hình 104B chỉ ghi nhận mức tăng perplexity 3,6%. So sánh với các giải pháp thay thế như KVTC (tỷ lệ nén lên đến 20 lần nhưng cần hiệu chỉnh), RotorQuant (xoay nhanh hơn nhưng chất lượng thấp hơn) và KIVI (tỷ lệ nén 16 lần, được tích hợp vào Hugging Face) mang lại bức tranh tổng thể toàn diện. Việc thiếu mã nguồn chính thức đã được giảm thiểu với hơn 15 bản triển khai từ cộng đồng.
Nguồn: Habr — хаб ИИ —
bản gốc
