teacher forcing. Однако новый анализ выявил, что ошибки концентрируются на первых позициях, что фатально для авторегрессионной генерации: при greedy-декодировании точность падает до 40% для Llama-3.1-8B. Авторы предложили метод progressive cramming, который наращивает длину префикса по одному токену, гарантируя 100% реконструкцию на каждом шаге. С помощью этого метода измерена ёмкость разных моделей: Llama-3.1-8B сжимает в среднем 1438 токенов, Pythia-1.4B — 430, SmolLM2-1.7B — 335, Gemma-3-4B — 214. Применение низкоразмерной проекции увеличивает ёмкость в 1.2–3.3 раза. Исследование траекторий оптимизации показало, что путь оптимизатора в пространстве эмбеддингов лежит в низкоразмерном подпространстве (30–100 компонент), хотя множество решений высокоразмерно. Главный результат: идеальная реконструкция не гарантирует сохранения смысла. Добавление сжатого эмбеддинга к контексту снижает точность на HellaSwag и ARC-Easy (например, для Llama-3.1-8B с 61,9% до 40,8% на HellaSwag), а на 5-shot MMLU точность падает почти до нуля. Причина — в ранних слоях трансформера: глушение внимания к эмбеддингу на ранних слоях восстанавливает способность рассуждать. Ёмкость сжатия растёт с глубиной и шириной модели; для SmolLM2 8 первых слоёв сжимают больше, чем полная модель.