Viimeisimmät innovaatiot LLM-arkkitehtuureissa: jaetut KV-välimuistit, kerroskohtaiset upotukset ja pakattu tarkkaavaisuus
Uudet avoimet LLM-mallit keskittyvät yhä enemmän tehokkaaseen pitkän kontekstin käsittelyyn. Gemma 4 (Google) käyttää KV-tensorin jakamista kerrosten välillä vähentääkseen välimuistin kokoa sekä kerroskohtaisia upotuksia parantamaan parametritehokkuutta. Laguna XS.2 (Poolside) hyödyntää kerroskohtaista tarkkaavaisuusbudjetointia, ja DeepSeek V4 esittelee mHC- ja pakatun tarkkaavaisuusmekanismit.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute






