Token压缩:完美文本压缩无法保留语义——AIRI研究
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
来自AIRI(FusionBrain)的研究人员发现了令牌压缩方法的关键问题,该方法允许将数千个令牌打包到一个嵌入中。结果表明,即使达到99.96%的重建准确率,模型也会丧失对压缩文本进行推理的能力。研究人员提出了一种名为渐进压缩的新协议,保证100%重建,但显示文本恢复并不等同于理解。
来自 AIRI 的 FusionBrain 实验室的研究团队在德米特里·塔拉索夫的带领下,于 ICML 2026 上发表了一篇论文,对 token cramming 方法进行了批判性分析——该方法将数百数千个文本令牌压缩成冻结大语言模型的一个输入嵌入。此前,同事尤里·库拉托夫(AIRI)的工作表明,在教师强制(teacher forcing)下,一个向量最多可以“封装”1568 个令牌,重构精度达 99.96%。然而,新的分析发现,错误集中在开头位置,这对自回归生成来说是致命的:在贪心解码(greedy decoding)下,Llama-3.1-8B 的精度降至 40%。作者提出了渐进式压缩方法(progressive cramming),每次增加一个令牌的前缀长度,保证每一步的 100% 重构。利用该方法测量了不同模型的容量:Llama-3.1-8B 平均压缩 1438 个令牌,Pythia-1.4B 为 430 个,SmolLM2-1.7B 为 335 个,Gemma-3-4B 为 214 个。应用低维投影后,容量提升了 1.2 至 3.3 倍。对优化轨迹的研究表明,优化器在嵌入空间中的路径位于低维子空间(30–100 个分量),尽管解集是高维的。主要发现:完美的重构并不能保证语义的保留。向上下文添加压缩嵌入会降低 HellaSwag 和 ARC-Easy 上的精度(例如,Llama-3.1-8B 在 HellaSwag 上从 61.9% 降至 40.8%),而在 5-shot MMLU 上,精度几乎降为零。原因在于 Transformer 的早期层:在早期层抑制对嵌入的注意力可以恢复推理能力。压缩容量随模型的深度和宽度增加;对于 SmolLM2,前 8 层的压缩量超过了完整模型。
来源: Habr — хаб ИИ —
原文
