Nghiên cứu 🇷🇺 27.07.2026 10:03

Token Cramming: Perfect Text Compression Does Not Preserve Meaning – AIRI Study

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Researchers from AIRI (FusionBrain) identified critical issues with the token cramming method, which allows packing thousands of tokens into a single embedding. It turned out that even at 99.96% reconstruction accuracy, the model loses its ability to reason over compressed text. A new protocol called progressive cramming was proposed, guaranteeing 100% reconstruction but showing that text recovery does not equal understanding.
Nhóm nghiên cứu từ phòng thí nghiệm FusionBrain AIRI dưới sự dẫn dắt của Dmitry Tarasov đã trình bày tại ICML 2026 một công trình phân tích phê bình phương pháp token cramming - nén hàng trăm và hàng nghìn token văn bản thành một embedding đầu vào duy nhất của mô hình ngôn ngữ lớn (Large Language Model - LLM) đã bị đóng băng. Trước đó, công trình của đồng nghiệp Yuri Kuratov (AIRI) cho thấy có thể "đóng gói" tới 1568 token vào một vector duy nhất với độ chính xác tái tạo 99,96% khi sử dụng teacher forcing. Tuy nhiên, phân tích mới đã phát hiện ra rằng các lỗi tập trung ở các vị trí đầu tiên, điều này gây tử vong cho quá trình sinh tự hồi quy: với giải mã tham lam (greedy decoding), độ chính xác giảm xuống còn 40% đối với Llama-3.1-8B. Các tác giả đã đề xuất phương pháp progressive cramming, phương pháp này tăng dần độ dài tiền tố theo từng token, đảm bảo tái tạo 100% ở mỗi bước. Sử dụng phương pháp này, dung lượng của các mô hình khác nhau đã được đo: Llama-3.1-8B nén trung bình 1438 token, Pythia-1.4B - 430, SmolLM2-1.7B - 335, Gemma-3-4B - 214. Việc áp dụng phép chiếu chiều thấp làm tăng dung lượng lên 1,2-3,3 lần. Nghiên cứu về quỹ đạo tối ưu hóa cho thấy đường đi của bộ tối ưu trong không gian embedding nằm trong một không gian con chiều thấp (30-100 thành phần), mặc dù tập hợp các giải pháp có chiều cao. Kết quả chính: tái tạo hoàn hảo không đảm bảo giữ nguyên ý nghĩa. Việc thêm embedding nén vào ngữ cảnh làm giảm độ chính xác trên HellaSwag và ARC-Easy (ví dụ, đối với Llama-3.1-8B từ 61,9% xuống 40,8% trên HellaSwag), và trên MMLU 5-shot độ chính xác giảm xuống gần như bằng không. Nguyên nhân nằm ở các lớp đầu của transformer: làm suy yếu sự chú ý đến embedding ở các lớp đầu phục hồi khả năng suy luận. Dung lượng nén tăng lên theo độ sâu và độ rộng của mô hình; đối với SmolLM2, 8 lớp đầu tiên nén nhiều hơn toàn bộ mô hình.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới