LLM-arkkitehtuurien innovaatiot: KV-jako, kerroskohtaiset upotukset ja pakattu huomio
Sebastian Raschka tarkastelee tuoreita avoimen painon LLM-arkkitehtuurien edistysaskeleita, jotka keskittyvät pitkän kontekstin tehokkuuteen. Keskeisiä tekniikoita ovat KV-jako kerrosten välillä (Gemma 4), kerroskohtaiset upotukset (Gemma 4 E2B/E4B), kerroskohtainen huomion budjetointi (Laguna XS.2), pakattu konvoluutiohuomio (ZAYA1) ja mHC pakatuulla huomiolla (DeepSeek V4). Nämä vähentävät KV-välimuistin kokoa ja muistiliikennettä päättely- ja agenttityönkuluissa.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute



