TutkimusMallit 🇺🇸 27.07.2026 13:06

Viimeisimmät innovaatiot LLM-arkkitehtuureissa: jaetut KV-välimuistit, kerroskohtaiset upotukset ja pakattu tarkkaavaisuus

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Uudet avoimet LLM-mallit keskittyvät yhä enemmän tehokkaaseen pitkän kontekstin käsittelyyn. Gemma 4 (Google) käyttää KV-tensorin jakamista kerrosten välillä vähentääkseen välimuistin kokoa sekä kerroskohtaisia upotuksia parantamaan parametritehokkuutta. Laguna XS.2 (Poolside) hyödyntää kerroskohtaista tarkkaavaisuusbudjetointia, ja DeepSeek V4 esittelee mHC- ja pakatun tarkkaavaisuusmekanismit.
Artikkelissa tarkastellaan viimeisimpiä arkkitehtuurimuutoksia avoimissa suurissa kielimalleissa, jotka tähtäävät kustannusten vähentämiseen pitkän kontekstin käsittelyssä. Googlen Gemma 4 -mallit (E2B, E4B) käyttävät jaettua KV-välimuistia: myöhemmät kerrokset käyttävät uudelleen saman huomiotyypin aiempien kerrosten avaimia ja arvoja, mikä mahdollistaa KV-välimuistin koon puolittamisen (esimerkiksi E2B:ssä 128K:n kontekstissa säästö on 2,7 Gt bfloat16-tarkkuudella). Lisäksi E2B- ja E4B-versioissa käytetään kerroskohtaisia upotuksia (per-layer embeddings, PLE): jokainen transformeri-lohko saa pienen token-spesifisen vektorin yhteisestä 'paketoidusta' taulukosta, mikä lisää mallin kapasiteettia ilman peruslohkojen parametrien suhteellista kasvua. Poolside-yrityksen Laguna XS.2 -malli toteuttaa kerroskohtaisen huomion budjetoinnin: 40 kerroksesta vain 10:llä on täysi (globaali) huomio, ja lopuilla 30:lla on liukuva ikkuna (512 tokenia), mikä säästää resursseja. Lopuksi DeepSeek V4 käyttää mHC-mekanismeja (multi-head compression) ja pakattua huomiota lisäoptimointiin. Kaikki nämä tekniikat, vaikka vaikuttavatkin pieniltä parannuksilta, vähentävät merkittävästi muistin ja laskennan kuormitusta pitkien sekvenssien käsittelyssä.
Lähde: Sebastian Raschka — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset