トークンクランミング:理想的なテキスト圧縮は意味を保持しない – AIRI研究
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
AIRIの研究者らは、最大1568トークンを単一の埋め込みに圧縮するトークンクランミング手法が、意味の保持を保証しないことを実証しました。貪欲復号では精度が99.96%から40%に低下します。100%の再構成を達成する新しい手法「プログレッシブクランミング」が提案されましたが、完全に圧縮された埋め込みでもモデルの推論能力が損なわれ、その原因はトランスフォーマーの初期層にあることが判明しました。
AIRIの研究者らはトークンクラメリング法を研究しました。この手法では、凍結された大規模言語モデル(LLM)の単一の埋め込みに最大1,568トークンを圧縮し、99%以上の再構築精度を達成します。しかし、教師強制から貪欲復号に切り替えると、最初のトークンに誤差が集中し、精度が40%に低下します。著者らはプログレッシブクラメリングを提案し、これによりトークンを1つずつ段階的に追加することで100%の再構築を保証します。この手法を用いて、さまざまなモデルの圧縮容量を測定しました。例えば、Llama-3.1-8Bは1,438トークンを圧縮し、低次元投影を用いると最大1,697トークンまで圧縮可能です。最適化軌跡の研究により、それらが低次元部分空間(30~100成分)にあることが示されました。主な結果として、完全に圧縮された埋め込みでも、元のプレフィックスと一緒に入力すると、HellaSwagの精度が(Llamaでは61.9%から40.8%に)低下し、MMLUではゼロにまで落ちます。その理由は初期の変換器層にあります。アテンションノックアウトにより、最初の層での相互作用が再構築には必要だが、理解を妨げることが明らかになりました。圧縮容量はモデルの深さと幅に単調に増加します。また、トークンの圧縮困難度はそのサプライザルによって予測できることも判明しました。
出典: Habr — хаб ИИ —
原文
