Token Cramming: Perfect Text Compression Does Not Preserve Meaning – AIRI Study
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Researchers from AIRI (FusionBrain) identified critical issues with the token cramming method, which allows packing thousands of tokens into a single embedding. It turned out that even at 99.96% reconstruction accuracy, the model loses its ability to reason over compressed text. A new protocol called progressive cramming was proposed, guaranteeing 100% reconstruction but showing that text recovery does not equal understanding.
FusionBrain AIRI प्रयोगशाला के शोधकर्ताओं की एक टीम ने दिमित्री तारासोव के नेतृत्व में ICML 2026 में एक पेपर प्रस्तुत किया, जिसमें टोकन क्रैमिंग विधि का गंभीर विश्लेषण किया गया है - यह एक जमे हुए LLM में सैकड़ों और हज़ारों टेक्स्ट टोकन को एक इनपुट एम्बेडिंग में संपीड़ित करने की विधि है। पहले एक सहयोगी यूरी कुराटोव (AIRI) के काम ने दिखाया था कि टीचर फोर्सिंग के दौरान 99.96% पुनर्निर्माण सटीकता के साथ एक वेक्टर में 1568 टोकन तक 'पैक' किए जा सकते हैं। हालांकि, नए विश्लेषण से पता चला कि त्रुटियाँ पहली स्थितियों पर केंद्रित होती हैं, जो ऑटोरेग्रेसिव जनरेशन के लिए घातक है: ग्रीडी-डिकोडिंग के दौरान Llama-3.1-8B के लिए सटीकता 40% तक गिर जाती है। लेखकों न प्रोग्रेसिव क्रैमिंग विधि का प्रस्ताव रखा, जो प्रत्येक चरण में 100% पुनर्निर्माण की गारंटी देते हुए एक-एक टोकन करके प्रीफ़िक्स की लंबाई बढ़ाती है। इस विधि का उपयोग करके विभिन्न मॉडलों की क्षमता मापी गई: Llama-3.1-8B औसतन 1438 टोकन संपीड़ित करता है, Pythia-1.4B 430, SmolLM2-1.7B 335, Gemma-3-4B 214। निम्न-आयामी प्रक्षेपण के अनुप्रयोग से क्षमता 1.2–3.3 गुना बढ़ जाती है। ऑप्टिमाइज़ेशन प्रक्षेप पथों के अध्ययन से पता चला कि एम्बेडिंग स्पेस में ऑप्टिमाइज़र का पथ निम्न-आयामी उप-स्थान (30–100 घटक) में होता है, हालाँकि समाधानों का सेट उच्च-आयामी होता है। मुख्य परिणाम: आदर्श पुनर्निर्माण अर्थ के संरक्षण की गारंटी नहीं देता है। संपीड़ित एम्बेडिंग को संदर्भ में जोड़ने से HellaSwag और ARC-Easy पर सटीकता कम हो जाती है (उदाहरण के लिए, Llama-3.1-8B के लिए HellaSwag पर 61.9% से 40.8% तक), और 5-शॉट MMLU पर सटीकता लगभग शून्य तक गिर जाती है। इसका कारण ट्रांसफॉर्मर की प्रारंभिक परतों में है: प्रारंभिक परतों में एम्बेडिंग पर ध्यान को दबाने से तर्क करने की क्षमता बहाल हो जाती है। संपीड़न क्षमता मॉडल की गहराई और चौड़ाई के साथ बढ़ती है; SmolLM2 के लिए पहली 8 परतें पूरे मॉडल से अधिक संपीड़ित करती हैं।
स्रोत: Habr — хаб ИИ —
मूल
