Token Cramming -menetelmä: Ihanteellinen tekstin tiivistys ei säilytä merkitystä – AIRI-tutkimus
Meta
EleutherAI
Hugging Face
Google/DeepMind
Alibaba/Qwen
AIRI:n tutkijat osoittivat, että token cramming -menetelmä, joka tiivistää jopa 1568 tokenia yhteen upotukseen, ei takaa merkityksen säilymistä: ahneen dekoodauksen tarkkuus putoaa 99,96 prosentista 40 prosenttiin. Uusi menetelmä, progressiivinen cramming, esitettiin saavuttamaan 100 prosentin rekonstruktio, mutta havaittiin, että jopa täydellisesti tiivistetty upotus heikentää mallin päättelykykyä, ja syy on muuntajan aikaisissa kerroksissa.
AIRI:n tutkijat tutkivat tokenien pakkausmenetelmää, joka pakkaa jopa 1 568 tokenia yhdeksi upotukseksi jäädytetyssä suuressa kielimallissa rekonstruktiotarkkuudella yli 99 prosenttia. Kuitenkin siirryttäessä opettajapakotuksesta ahneeseen dekoodaukseen tarkkuus laskee 40 prosenttiin, koska virheet keskittyvät ensimmäisiin tokeneihin. Kirjoittajat ehdottivat progressiivista pakkausta, joka takaa 100 prosentin rekonstruktion lisäämällä tokeneita yksitellen. Tällä menetelmällä he mittasivat eri mallien pakkauskapasiteettia: esimerkiksi Llama-3.1-8B pakkaa 1 438 tokenia ja matalan dimensionaalisella projektiolla jopa 1 697 tokenia. Optimointipolkujen tutkiminen osoitti, että ne sijaitsevat matalan dimensionaalisessa aliavaruudessa (30–100 komponenttia). Tärkein tulos: jopa täydellisesti pakattu upotus, kun se syötetään yhdessä alkuperäisen etuliitteen kanssa, laskee tarkkuutta HellaSwagissa (Llama: 61,9 prosentista 40,8 prosenttiin) ja laskee nollaan MMLU:ssa. Syy on aikaisissa transformatorikerroksissa: huomion pudottaminen paljasti, että vuorovaikutukset ensimmäisissä kerroksissa ovat välttämättömiä rekonstruktiolle mutta haittaavat ymmärtämistä. Pakkauskapasiteetti kasvaa monotonisesti mallin syvyyden ja leveyden myötä. Lisäksi havaittiin, että tokenin pakkaamisen vaikeutta ennustaa sen yllätysarvo.
Lähde: Habr — хаб ИИ —
Alkuperäinen
