Token挤压法:理想文本压缩不保留语义——AIRI研究
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
AIRI研究人员证明,token挤压法(将多达1568个token压缩到单个嵌入中)并不能保证语义保留:在贪婪解码下,准确率从99.96%降至40%。他们提出了一种新方法——渐进式挤压,实现了100%的重建,但发现即使完美压缩的嵌入也会损害模型的推理能力,原因在于transformer的早期层。
AIRI 研究人员研究了令牌压缩方法,该方法能将最多 1,568 个令牌压缩到冻结大型语言模型的单个嵌入中,重建准确率超过 99%。然而,从教师强制转换为贪婪解码时,准确率降至 40%,因为错误集中在初始令牌上。作者提出了渐进式压缩,通过逐个递增地添加令牌来保证 100% 的重建。使用该方法,他们测量了各种模型的压缩容量:例如,Llama-3.1-8B 可压缩 1,438 个令牌,而结合低维投影后可达 1,697 个。对优化轨迹的研究表明,它们位于低维子空间(30-100 个成分)中。主要结果:即使一个完美压缩的嵌入,与原始前缀一同输入时,也会降低 HellaSwag 上的准确率(对于 Llama,从 61.9% 降至 40.8%),并在 MMLU 上降至零。原因在于早期 Transformer 层:注意力消除实验表明,前几层的交互对于重建是必要的,但会妨碍理解。压缩容量随模型深度和宽度单调增加。还发现,令牌压缩的难度可通过其惊奇度预测。
来源: Habr — хаб ИИ —
原文
