Token Cramming: Perfect Text Compression Does Not Preserve Meaning – AIRI Study
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Researchers from AIRI (FusionBrain) identified critical issues with the token cramming method, which allows packing thousands of tokens into a single embedding. It turned out that even at 99.96% reconstruction accuracy, the model loses its ability to reason over compressed text. A new protocol called progressive cramming was proposed, guaranteeing 100% reconstruction but showing that text recovery does not equal understanding.
Группа исследователей из лаборатории FusionBrain AIRI под руководством Дмитрия Тарасова представила на ICML 2026 работу, в которой критически анализируется метод token cramming — сжатие сотен и тысяч токенов текста в один входной эмбеддинг замороженной LLM. Ранее работа коллеги Юрия Куратова (AIRI) показала, что в один вектор можно «упаковать» до 1568 токенов с точностью реконструкции 99,96% при teacher forcing. Однако новый анализ выявил, что ошибки концентрируются на первых позициях, что фатально для авторегрессионной генерации: при greedy-декодировании точность падает до 40% для Llama-3.1-8B. Авторы предложили метод progressive cramming, который наращивает длину префикса по одному токену, гарантируя 100% реконструкцию на каждом шаге. С помощью этого метода измерена ёмкость разных моделей: Llama-3.1-8B сжимает в среднем 1438 токенов, Pythia-1.4B — 430, SmolLM2-1.7B — 335, Gemma-3-4B — 214. Применение низкоразмерной проекции увеличивает ёмкость в 1.2–3.3 раза. Исследование траекторий оптимизации показало, что путь оптимизатора в пространстве эмбеддингов лежит в низкоразмерном подпространстве (30–100 компонент), хотя множество решений высокоразмерно. Главный результат: идеальная реконструкция не гарантирует сохранения смысла. Добавление сжатого эмбеддинга к контексту снижает точность на HellaSwag и ARC-Easy (например, для Llama-3.1-8B с 61,9% до 40,8% на HellaSwag), а на 5-shot MMLU точность падает почти до нуля. Причина — в ранних слоях трансформера: глушение внимания к эмбеддингу на ранних слоях восстанавливает способность рассуждать. Ёмкость сжатия растёт с глубиной и шириной модели; для SmolLM2 8 первых слоёв сжимают больше, чем полная модель.
출처: Habr — хаб ИИ —
원문
