Tutkimus 🇷🇺 27.07.2026 10:03

Token Cramming: Täydellinen tekstin pakkaus ei säilytä merkitystä – AIRI-tutkimus

MetaMeta EleutherAIEleutherAI Hugging FaceHugging Face Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen
AIRI:n (FusionBrain) tutkijat tunnistivat kriittisiä ongelmia token cramming -menetelmässä, joka mahdollistaa tuhansien tokenien pakkaamisen yhteen upotukseen. Kävi ilmi, että jopa 99,96 %:n rekonstruktiotarkkuudella malli menettää kykynsä päätellä pakattua tekstiä. Ehdotettiin uutta protokollaa nimeltä progressiivinen cramming, joka takaa 100 %:n rekonstruktion, mutta osoittaa, että tekstin palauttaminen ei vastaa ymmärtämistä.
Tutkijaryhmä FusionBrain AIRI -laboratoriosta Dmitri Tarasovin johdolla esitteli ICML 2026 -konferenssissa työn, jossa analysoidaan kriittisesti token cramming -menetelmää — satojen tai tuhansien tekstin tokenien pakkaamista yhdeksi tuloembedoinniksi jäädytetyssä LLM:ssä (Large Language Model, suuri kielimalli). Aiempi kollega Juri Kuratovin (AIRI) työ osoitti, että yhteen vektoriin voidaan ”pakata” jopa 1568 tokenia 99,96 %:n rekonstruktiotarkkuudella teacher forcing -menetelmällä. Uusi analyysi paljasti kuitenkin, että virheet keskittyvät ensimmäisiin positioihin, mikä on kohtalokasta autoregressiiviselle generoinnille: greedy-dekoodauksella tarkkuus putoaa 40 %:iin Llama-3.1-8B-mallille. Tekijät ehdottivat progressive cramming -menetelmää, joka kasvattaa prefiksin pituutta yhden tokenin kerrallaan ja takaa 100 %:n rekonstruktion jokaisella askeleella. Tällä menetelmällä mitattiin eri mallien kapasiteetti: Llama-3.1-8B pakkaa keskimäärin 1438 tokenia, Pythia-1.4B 430, SmolLM2-1.7B 335 ja Gemma-3-4B 214 tokenia. Mataladimensionaalinen projektio lisää kapasiteettia 1,2–3,3 kertaisesti. Optimointipolkujen tutkimus osoitti, että optimoijan reitti embedointiavaruudessa on mataladimensionaalisessa aliavaruudessa (30–100 komponenttia), vaikka ratkaisujoukko on korkeadimensionaalinen. Päätulos: täydellinen rekonstruktio ei takaa merkityksen säilymistä. Pakatun embedoinnin lisääminen kontekstiin heikentää tarkkuutta HellaSwag- ja ARC-Easy-testeissä (esimerkiksi Llama-3.1-8B:llä 61,9 %:sta 40,8 %:iin HellaSwagissa), ja 5-shot MMLU-testissä tarkkuus putoaa lähes nollaan. Syynä ovat muuntajan varhaiset kerrokset: embedoinnin huomioinnin vaimentaminen varhaisissa kerroksissa palauttaa päättelykyvyn. Pakkauskapasiteetti kasvaa mallin syvyyden ja leveyden myötä; SmolLM2:ssa 8 ensimmäistä kerrosta pakkaavat enemmän kuin koko malli.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset