ForschungModelle 🇷🇺 27.07.2026 10:03

Token Cramming: Ideale Textkompression erhält nicht die Bedeutung – AIRI-Studie

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
Forscher am AIRI zeigten, dass die Token-Cramming-Methode, die bis zu 1568 Token in eine einzige Einbettung komprimiert, die Bedeutungserhaltung nicht garantiert: Bei gieriger Dekodierung sinkt die Genauigkeit von 99,96% auf 40%. Es wurde eine neue Methode, progressives Cramming, vorgeschlagen, um eine 100%ige Rekonstruktion zu erreichen, aber es zeigte sich, dass selbst eine perfekt komprimierte Einbettung die Argumentationsfähigkeit des Modells beeinträchtigt, und die Ursache liegt in den frühen Schichten des Transformers.
Forscher von AIRI untersuchten die Token-Cramming-Methode, die bis zu 1.568 Token in eine einzige Einbettung eines eingefrorenen LLM mit einer Rekonstruktionsgenauigkeit von über 99 % komprimiert. Beim Übergang von Teacher Forcing zu Greedy Decoding sinkt die Genauigkeit jedoch auf 40 %, da sich Fehler auf die ersten Token konzentrieren. Die Autoren schlugen Progressive Cramming vor, das eine 100-prozentige Rekonstruktion garantiert, indem Token schrittweise einzeln hinzugefügt werden. Mit dieser Methode maßen sie die Kompressionskapazität verschiedener Modelle: Beispielsweise komprimiert Llama-3.1-8B 1.438 Token, und mit niedrigdimensionaler Projektion bis zu 1.697. Die Untersuchung der Optimierungstrajektorien zeigte, dass diese in einem niedrigdimensionalen Unterraum (30–100 Komponenten) liegen. Das Hauptergebnis: Selbst eine perfekt komprimierte Einbettung reduziert die Genauigkeit bei HellaSwag (von 61,9 % auf 40,8 % für Llama) und fällt bei MMLU auf null, wenn sie zusammen mit dem ursprünglichen Präfix eingegeben wird. Der Grund liegt in den frühen Transformer-Schichten: Attention Knockout ergab, dass Interaktionen in den ersten Schichten für die Rekonstruktion notwendig sind, aber das Verständnis behindern. Die Kompressionskapazität steigt monoton mit der Modelltiefe und -breite. Es wurde auch festgestellt, dass die Schwierigkeit der Komprimierung eines Tokens durch seine Überraschung vorhergesagt wird.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten