LLM-architectuurinnovaties: KV-deling, per-laag-embeddings en gecomprimeerde aandacht
Sebastian Raschka bespreekt recente ontwikkelingen in opengewicht LLM-architecturen, gericht op efficiëntie bij lange contexten. Belangrijke technieken zijn KV-deling over lagen (Gemma 4), per-laag-embeddings (Gemma 4 E2B/E4B), laaggewijze aandachtsbudgettering (Laguna XS.2), gecomprimeerde convolutionele aandacht (ZAYA1) en mHC met gecomprimeerde aandacht (DeepSeek V4). Deze verminderen de KV-cachegrootte en geheugenbandbreedte voor redeneer- en agentworkflows.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute



