Token Cramming: Perfect Text Compression Does Not Preserve Meaning – AIRI Study
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Researchers from AIRI (FusionBrain) identified critical issues with the token cramming method, which allows packing thousands of tokens into a single embedding. It turned out that even at 99.96% reconstruction accuracy, the model loses its ability to reason over compressed text. A new protocol called progressive cramming was proposed, guaranteeing 100% reconstruction but showing that text recovery does not equal understanding.
FusionBrain AIRI laboratuvarından Dmitry Tarasov liderliğindeki bir araştırmacı grubu, ICML 2026'da sunulan çalışmalarında "token cramming" yöntemini eleştirel bir şekilde analiz etti. Bu yöntem, yüzlerce ve binlerce token metni, dondurulmuş bir Büyük Dil Modelinin (LLM) tek bir giriş embedding'ine sıkıştırmayı içeriyor. Daha önce AIRI'den meslektaş Yuri Kuratov'un çalışması, teacher forcing ile %99,96 rekonstrüksiyon doğruluğuyla tek bir vektöre 1568 tokena kadar "paketlenebileceğini" göstermişti. Ancak yeni analiz, hataların ilk konumlarda yoğunlaştığını ve bunun otoregresif üretim için ölümcül olduğunu ortaya koydu: greedy kod çözümünde Llama-3.1-8B için doğruluk %40'a düşüyor. Yazarlar, her adımda %100 rekonstrüksiyonu garanti ederek prefix uzunluğunu birer token artıran aşamalı sıkıştırma (progressive cramming) yöntemini önerdi. Bu yöntemle farklı modellerin kapasitesi ölçüldü: Llama-3.1-8B ortalama 1438 token, Pythia-1.4B 430 token, SmolLM2-1.7B 335 token, Gemma-3-4B ise 214 token sıkıştırıyor. Düşük boyutlu projeksiyon kullanımı kapasiteyi 1.2 ile 3.3 kat artırıyor. Optimizasyon yörüngeleri üzerine yapılan araştırma, optimizasyon yolunun embedding uzayında düşük boyutlu bir altuzayda (30–100 bileşen) yer aldığını, ancak çözüm kümesinin yüksek boyutlu olduğunu gösterdi. Ana sonuç: Mükemmel rekonstrüksiyon anlamın korunmasını garanti etmez. Sıkıştırılmış embedding'in bağlama eklenmesi HellaSwag ve ARC-Easy'de doğruluğu düşürüyor (örneğin Llama-3.1-8B için HellaSwag'da %61,9'dan %40,8'e) ve 5-shot MMLU'da doğruluk neredeyse sıfıra iniyor. Bunun nedeni transformatörün erken katmanlarında yatıyor: Erken katmanlarda embedding'e dikkati bastırmak, akıl yürütme yeteneğini geri kazandırıyor. Sıkıştırma kapasitesi modelin derinliği ve genişliğiyle artıyor; SmolLM2 için ilk 8 katman, tam modelden daha fazla sıkıştırıyor.
Kaynak: Habr — хаб ИИ —
orijinal
