⚡ BREAKING
LLM-architectuurinnovaties: KV-deling, per-laag-embeddings en gecomprimeerde aandacht
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka bespreekt recente ontwikkelingen in opengewicht LLM-architecturen, gericht op efficiëntie bij lange contexten. Belangrijke technieken zijn KV-deling over lagen (Gemma 4), per-laag-embeddings (Gemma 4 E2B/E4B), laaggewijze aandachtsbudgettering (Laguna XS.2), gecomprimeerde convolutionele aandacht (ZAYA1) en mHC met gecomprimeerde aandacht (DeepSeek V4). Deze verminderen de KV-cachegrootte en geheugenbandbreedte voor redeneer- en agentworkflows.
Sebastian Raschka onderzoekt recente architectuurwijzigingen in open-weight LLM's die gericht zijn op het verlagen van de kosten voor lange contexten. In Gemma 4 E2B/E4B hergebruiken latere lagen key-value-statussen van eerdere lagen (cross-layer attention), wat ongeveer de helft van de KV-cachegrootte bespaart (bijvoorbeeld 2,7 GB bij 128K context). Daarnaast gebruiken deze modellen per-laag-embeddings (PLE) om de capaciteit te vergroten zonder de hoofdtransformer-stack uit te breiden; het 'effectieve' aantal parameters is kleiner dan de totale inclusief embeddings. Laguna XS.2 van Poolside varieert de attentionkosten per laag, met 30 sliding-window-lagen (window 512) en 10 full-attention-lagen. ZAYA1-8B introduceert gecomprimeerde convolutionele attention, en DeepSeek V4 gebruikt mHC en gecomprimeerde attention. Deze aanpassingen worden gemotiveerd door de groeiende behoefte aan efficiënte verwerking van lange contexten in redeneermodellen en agentworkflows.
Bron: Sebastian Raschka —
origineel
