Token Cramming: Perfecte tekstcompressie behoudt betekenis niet – AIRI-studie
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Onderzoekers van AIRI (FusionBrain) hebben kritieke problemen geïdentificeerd met de token cramming-methode, waarmee duizenden tokens in één enkele embedding kunnen worden gepakt. Het bleek dat zelfs bij 99,96% reconstructienauwkeurigheid het model zijn vermogen verliest om te redeneren over gecomprimeerde tekst. Er werd een nieuw protocol voorgesteld, genaamd progressive cramming, dat 100% reconstructie garandeert, maar aantoont dat tekstherstel niet gelijkstaat aan begrip.
Een groep onderzoekers van het FusionBrain AIRI-laboratorium onder leiding van Dmitri Tarasov heeft op ICML 2026 een werk gepresenteerd waarin de methode token cramming kritisch wordt geanalyseerd: het comprimeren van honderden en duizenden tokens tekst tot één invoerembedding van een bevroren large language model. Eerder werk van collega Joeri Kocratov (AIRI) toonde aan dat tot 1568 tokens in één vector kunnen worden 'verpakt' met een reconstructienauwkeurigheid van 99,96% bij teacher forcing. De nieuwe analyse onthulde echter dat fouten zich concentreren op de eerste posities, wat fataal is voor autoregressieve generatie: bij greedy-decoding daalt de nauwkeurigheid tot 40% voor Llama-3.1-8B. De auteurs stelden de methode progressive cramming voor, die de prefixlengte token voor token opbouwt en zo 100% reconstructie op elke stap garandeert. Met deze methode werd de capaciteit van verschillende modellen gemeten: Llama-3.1-8B comprimeert gemiddeld 1438 tokens, Pythia-1.4B 430, SmolLM2-1.7B 335 en Gemma-3-4B 214. Toepassing van laagdimensionale projectie verhoogt de capaciteit met een factor 1,2 tot 3,3. Onderzoek van optimalisatietrajecten toonde aan dat het pad van de optimizer in de embeddingruimte in een laagdimensionale deelruimte ligt (30–100 componenten), hoewel de verzameling oplossingen hoogdimensionaal is. Het belangrijkste resultaat: perfecte reconstructie garandeert niet dat de betekenis behouden blijft. Het toevoegen van een gecomprimeerde embedding aan de context verlaagt de nauwkeurigheid op HellaSwag en ARC-Easy (bijvoorbeeld voor Llama-3.1-8B van 61,9% naar 40,8% op HellaSwag), en op 5-shot MMLU daalt de nauwkeurigheid bijna tot nul. De oorzaak ligt in de vroege lagen van de transformer: het dempen van de aandacht voor de embedding in vroege lagen herstelt het redeneervermogen. De compressiecapaciteit neemt toe met de diepte en breedte van het model; voor SmolLM2 comprimeren de eerste 8 lagen meer dan het volledige model.
Bron: Habr — хаб ИИ —
origineel
