Nghiên cứuMô hình 🇷🇺 27.07.2026 10:03

Token Cramming: Nén văn bản lý tưởng không bảo toàn ý nghĩa – Nghiên cứu của AIRI

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Các nhà nghiên cứu tại AIRI đã chỉ ra rằng phương pháp token cramming, nén tới 1568 token vào một embedding duy nhất, không đảm bảo bảo toàn ý nghĩa: dưới giải mã tham lam (greedy decoding), độ chính xác giảm từ 99,96% xuống 40%. Một phương pháp mới, progressive cramming, được đề xuất để đạt được tái tạo 100%, nhưng phát hiện rằng ngay cả một embedding được nén hoàn hảo cũng làm suy yếu khả năng suy luận của mô hình, và nguyên nhân nằm ở các lớp đầu của transformer.
Các nhà nghiên cứu tại AIRI đã nghiên cứu phương pháp nhồi token (token cramming), giúp nén tới 1.568 token thành một embedding duy nhất của một mô hình ngôn ngữ lớn (LLM) đã đông lạnh với độ chính xác tái tạo trên 99%. Tuy nhiên, khi chuyển từ teacher forcing sang giải mã tham lam (greedy decoding), độ chính xác giảm xuống còn 40%, vì lỗi tập trung ở các token đầu tiên. Các tác giả đề xuất phương pháp nhồi token tiến dần (progressive cramming), đảm bảo tái tạo 100% bằng cách thêm dần từng token một. Sử dụng phương pháp này, họ đo khả năng nén của nhiều mô hình khác nhau: ví dụ, Llama-3.1-8B nén được 1.438 token, và với phép chiếu chiều thấp (low-dimensional projection), lên tới 1.697 token. Nghiên cứu các quỹ đạo tối ưu hóa cho thấy chúng nằm trong một không gian con chiều thấp (30–100 thành phần). Kết quả chính: ngay cả một embedding được nén hoàn hảo, khi được đưa vào cùng với tiền tố gốc (original prefix), cũng làm giảm độ chính xác trên HellaSwag (từ 61,9% xuống 40,8% đối với Llama) và giảm về 0 trên MMLU. Nguyên nhân nằm ở các lớp transformer đầu tiên: kỹ thuật knockout sự chú ý (attention knockout) cho thấy tương tác trong các lớp đầu tiên là cần thiết cho việc tái tạo nhưng lại cản trở khả năng hiểu. Khả năng nén tăng đơn điệu theo độ sâu và chiều rộng của mô hình. Người ta cũng phát hiện rằng độ khó nén của một token được dự đoán bởi độ bất ngờ (surprisal) của nó.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới