Token Cramming: Perfekte Textkompression bewahrt die Bedeutung nicht – AIRI-Studie
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Forscher von AIRI (FusionBrain) identifizierten kritische Probleme mit der Token-Cramming-Methode, die es ermöglicht, Tausende von Token in ein einzelnes Embedding zu packen. Es stellte sich heraus, dass selbst bei 99,96% Rekonstruktionsgenauigkeit das Modell seine Fähigkeit verliert, über komprimierten Text zu argumentieren. Es wurde ein neues Protokoll namens Progressive Cramming vorgeschlagen, das eine 100%ige Rekonstruktion garantiert, aber zeigt, dass Textwiederherstellung nicht gleichbedeutend mit Verständnis ist.
Eine Forschergruppe des FusionBrain AIRI-Labors unter der Leitung von Dmitry Tarasov hat auf der ICML 2026 eine Arbeit vorgestellt, die die Methode des Token Cramming – die Kompression von Hunderten oder Tausenden von Text-Token in einen einzigen Eingabe-Embedding eines eingefrorenen Large Language Models (LLM) – kritisch analysiert. Eine frühere Arbeit des Kollegen Yuri Kuratov (AIRI) hatte gezeigt, dass sich bis zu 1568 Token in einen einzigen Vektor „packen“ lassen, mit einer Rekonstruktionsgenauigkeit von 99,96 % bei Teacher Forcing. Die neue Analyse deckte jedoch auf, dass die Fehler auf den ersten Positionen konzentriert sind, was für die autoregressive Generierung fatal ist: Beim Greedy-Decoding sinkt die Genauigkeit für Llama-3.1-8B auf 40 %. Die Autoren schlugen die Methode des Progressive Cramming vor, die die Präfixlänge Token für Token erhöht und so eine 100-prozentige Rekonstruktion in jedem Schritt garantiert. Mit dieser Methode wurde die Kapazität verschiedener Modelle gemessen: Llama-3.1-8B komprimiert im Durchschnitt 1438 Token, Pythia-1.4B 430, SmolLM2-1.7B 335 und Gemma-3-4B 214. Die Anwendung einer niedrigdimensionalen Projektion erhöht die Kapazität um den Faktor 1,2 bis 3,3. Eine Untersuchung der Optimierungspfade zeigte, dass der Weg des Optimierers im Embedding-Raum in einem niedrigdimensionalen Unterraum (30–100 Komponenten) verläuft, obwohl die Menge der Lösungen hochdimensional ist. Das Hauptergebnis: Perfekte Rekonstruktion garantiert nicht die Erhaltung der Bedeutung. Das Hinzufügen eines komprimierten Embeddings zum Kontext verringert die Genauigkeit bei HellaSwag und ARC-Easy (zum Beispiel für Llama-3.1-8B von 61,9 % auf 40,8 % bei HellaSwag), und bei 5-shot MMLU sinkt die Genauigkeit fast auf null. Der Grund liegt in den frühen Schichten des Transformers: Das Unterdrücken der Aufmerksamkeit auf das Embedding in den frühen Schichten stellt die Fähigkeit zum logischen Denken wieder her. Die Kompressionskapazität steigt mit der Tiefe und Breite des Modells; bei SmolLM2 komprimieren die ersten 8 Schichten mehr als das gesamte Modell.
Quelle: Habr — хаб ИИ —
Original
