Compression de jetons : la compression parfaite du texte ne préserve pas le sens – Étude AIRI
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Des chercheurs d'AIRI (FusionBrain) ont identifié des problèmes critiques avec la méthode de compression de jetons, qui permet de compresser des milliers de jetons en un seul plongement. Il s'est avéré que même avec une précision de reconstruction de 99,96 %, le modèle perd sa capacité à raisonner sur le texte compressé. Un nouveau protocole appelé compression progressive a été proposé, garantissant une reconstruction à 100 %, mais montrant que la récupération du texte n'équivaut pas à la compréhension.
Un groupe de chercheurs du laboratoire FusionBrain de l'Institut AIRI, dirigé par Dmitry Tarasov, a présenté à l'ICML 2026 un article qui analyse de manière critique la méthode de « token cramming », qui consiste à compresser des centaines voire des milliers de tokens de texte en un seul embedding d'entrée d'un LLM figé. Une précédente étude de Yuri Kuratov (AIRI) avait montré qu'il était possible de « compresser » jusqu'à 1568 tokens dans un seul vecteur avec une précision de reconstruction de 99,96 % en mode teacher forcing. Cependant, la nouvelle analyse a révélé que les erreurs se concentrent sur les premières positions, ce qui est fatal pour la génération autorégressive : en décodage glouton, la précision chute à 40 % pour Llama-3.1-8B. Les auteurs ont proposé une méthode de « progressive cramming », qui augmente la longueur du préfixe token par token, garantissant une reconstruction à 100 % à chaque étape. Grâce à cette méthode, la capacité de différents modèles a été mesurée : Llama-3.1-8B compresse en moyenne 1438 tokens, Pythia-1.4B 430, SmolLM2-1.7B 335 et Gemma-3-4B 214. L'utilisation d'une projection basse dimension augmente la capacité d'un facteur 1,2 à 3,3. L'étude des trajectoires d'optimisation a montré que le chemin de l'optimiseur dans l'espace des embeddings se situe dans un sous-espace de basse dimension (30 à 100 composantes), bien que l'ensemble des solutions soit de haute dimension. Le résultat principal : une reconstruction parfaite ne garantit pas la préservation du sens. L'ajout d'un embedding compressé au contexte réduit la précision sur HellaSwag et ARC-Easy (par exemple, pour Llama-3.1-8B, de 61,9 % à 40,8 % sur HellaSwag), et sur MMLU en 5-shot, la précision chute presque à zéro. La raison réside dans les premières couches du transformateur : l'annulation de l'attention à l'embedding dans les premières couches rétablit la capacité de raisonnement. La capacité de compression augmente avec la profondeur et la largeur du modèle ; pour SmolLM2, les 8 premières couches compressent plus que le modèle complet.
Source: Habr — хаб ИИ —
original
