Compression de jetons : la compression idéale ne préserve pas le sens – Étude de l'AIRI
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Les chercheurs de l'AIRI ont démontré que la méthode de compression de jetons, qui comprime jusqu'à 1568 jetons en un seul plongement, ne garantit pas la préservation du sens : en décodage glouton, la précision chute de 99,96 % à 40 %. Une nouvelle méthode, le cramming progressif, a été proposée pour atteindre une reconstruction à 100 %, mais il a été constaté que même un plongement parfaitement compressé nuit à la capacité de raisonnement du modèle, et la cause se situe dans les premières couches du transformeur.
Les chercheurs d'AIRI ont étudié la méthode de tassement de tokens, qui compresse jusqu'à 1 568 tokens en un seul embedding d'un LLM gelé avec une précision de reconstruction supérieure à 99 %. Cependant, lors du passage du teacher forcing au décodage glouton, la précision chute à 40 %, car les erreurs se concentrent sur les premiers tokens. Les auteurs ont proposé le tassement progressif, qui garantit une reconstruction à 100 % en ajoutant les tokens un par un de manière incrémentale. En utilisant cette méthode, ils ont mesuré la capacité de compression de divers modèles : par exemple, Llama-3.1-8B compresse 1 438 tokens, et avec projection de faible dimension, jusqu'à 1 697. L'étude des trajectoires d'optimisation a montré qu'elles se situent dans un sous-espace de faible dimension (30 à 100 composantes). Le résultat principal : même un embedding parfaitement compressé, lorsqu'il est fourni avec le préfixe original, réduit la précision sur HellaSwag (de 61,9 % à 40,8 % pour Llama) et tombe à zéro sur MMLU. La raison réside dans les premières couches du transformeur : l'élimination de l'attention a révélé que les interactions dans les premières couches sont nécessaires à la reconstruction mais entravent la compréhension. La capacité de compression augmente de manière monotone avec la profondeur et la largeur du modèle. Il a également été constaté que la difficulté de compression d'un token est prédite par sa surprise.
Source: Habr — хаб ИИ —
original
