研究 🇷🇺 27.07.2026 10:03

Token Cramming: Perfect Text Compression Does Not Preserve Meaning – AIRI Study

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Researchers from AIRI (FusionBrain) identified critical issues with the token cramming method, which allows packing thousands of tokens into a single embedding. It turned out that even at 99.96% reconstruction accuracy, the model loses its ability to reason over compressed text. A new protocol called progressive cramming was proposed, guaranteeing 100% reconstruction but showing that text recovery does not equal understanding.
AIRIのFusionBrainラボに所属するドミトリー・タラソフ率いる研究チームが、ICML 2026にて、トークンクランミング(凍結大規模言語モデルにおいて数百・数千のテキストトークンを単一の入力埋め込みに圧縮する手法)を批判的に分析した論文を発表した。以前の研究(AIRIのユーリ・クラトフ共同執筆)では、教師強制を用いた場合、最大1568トークンを単一のベクトルに「詰め込み」、再構成精度が99.96%に達することが示されていた。しかし、今回の新たな分析により、誤差が初期位置に集中することが明らかになり、自己回帰生成にとって致命的であることが判明した。例えば、Greedyデコーディングの場合、Llama-3.1-8Bでは精度が40%まで低下する。著者らは、プログレッシブクランミング手法を提案した。これはプレフィックス長を1トークンずつ徐々に拡大し、各ステップで100%の再構成を保証するものである。この手法を用いて、異なるモデルの容量を測定した:Llama-3.1-8Bは平均1438トークン、Pythia-1.4Bは430トークン、SmolLM2-1.7Bは335トークン、Gemma-3-4Bは214トークンを圧縮する。低次元射影を適用すると、容量が1.2倍から3.3倍増加する。最適化軌跡の分析により、埋め込み空間における最適化器の経路が低次元部分空間(30~100成分)に存在することが示されたが、解の集合は高次元である。主要な結果:完全な再構成は意味の保持を保証しない。圧縮埋め込みをコンテキストに追加すると、HellaSwagおよびARC-Easyでの精度が低下し(例:Llama-3.1-8BではHellaSwagで61.9%から40.8%へ)、5ショットMMLUでは精度がほぼゼロにまで低下する。原因はトランスフォーマーの初期層にある。初期層で埋め込みへの注意を抑制すると、推論能力が回復する。圧縮容量はモデルの深さと幅に伴って増加し、SmolLM2では最初の8層が完全なモデルよりも多くを圧縮する。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース