Token Cramming: идеальное сжатие текста не сохраняет смысл — исследование AIRI
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
Исследователи из AIRI (FusionBrain) выявили критические проблемы метода token cramming, который позволяет «упаковать» тысячи токенов в один эмбеддинг. Оказалось, что даже при 99,96% точности реконструкции модель теряет способность рассуждать над сжатым текстом. Предложен новый протокол progressive cramming, гарантирующий 100% реконструкцию, но показывающий, что восстановление текста не равно пониманию.
Группа исследователей из лаборатории FusionBrain AIRI под руководством Дмитрия Тарасова представила на ICML 2026 работу, в которой критически анализируется метод token cramming — сжатие сотен и тысяч токенов текста в один входной эмбеддинг замороженной LLM. Ранее работа коллеги Юрия Куратова (AIRI) показала, что в один вектор можно «упаковать» до 1568 токенов с точностью реконструкции 99,96% при
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- PCA = Principal Component Analysis — метод главных компонент
- MMLU = Massive Multitask Language Understanding — массовое многозадачное понимание языка
- ICML = International Conference on Machine Learning — Международная конференция по машинному обучению
Источник: Habr — хаб ИИ —
оригинал
