⚡ BREAKING
LLM-arkkitehtuurien innovaatiot: KV-jako, kerroskohtaiset upotukset ja pakattu huomio
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka tarkastelee tuoreita avoimen painon LLM-arkkitehtuurien edistysaskeleita, jotka keskittyvät pitkän kontekstin tehokkuuteen. Keskeisiä tekniikoita ovat KV-jako kerrosten välillä (Gemma 4), kerroskohtaiset upotukset (Gemma 4 E2B/E4B), kerroskohtainen huomion budjetointi (Laguna XS.2), pakattu konvoluutiohuomio (ZAYA1) ja mHC pakatuulla huomiolla (DeepSeek V4). Nämä vähentävät KV-välimuistin kokoa ja muistiliikennettä päättely- ja agenttityönkuluissa.
Sebastian Raschka kartoittaa viimeaikaisia avoimen painojen kielimallien (open-weight LLM) arkkitehtuurimuutoksia, joiden tavoitteena on vähentää pitkien kontekstien kustannuksia. Gemma 4 E2B/E4B:ssä myöhemmät kerrokset käyttävät uudelleen aiemmista kerroksista peräisin olevia avain-arvo (key-value) -tiloja (cross-layer attention), mikä säästää noin puolet KV-välimuistin koosta (esimerkiksi 2,7 gigatavua 128 000 tokenin kontekstissa). Lisäksi nämä mallit käyttävät kerroskohtaisia upotuksia (per-layer embeddings, PLE) kapasiteetin lisäämiseen ilman, että päätransformatoripinoa laajennetaan – ”todellinen” parametrimäärä on pienempi kuin upotukset sisältävä kokonaisparametrimäärä. Poolside-yhtiön Laguna XS.2 vaihtelee huomion kustannuksia kerroksittain: siinä on 30 liukuvaikkuna- (ikkuna 512) ja 10 täyshuomiokerrosta. ZAYA1-8B esittelee puristetun konvoluutiohuomion (compressed convolutional attention), ja DeepSeek V4 käyttää mHC:tä ja puristettua huomiota (compressed attention). Nämä hienosäädöt ovat saaneet motivaationsa kasvavasta tarpeesta tehokkaaseen pitkien kontekstien käsittelyyn päättelymalleissa ja agenttityönkuluissa.
Lähde: Sebastian Raschka —
Alkuperäinen
