OnderzoekModellen 🇺🇸 28.07.2026 15:05

Een visuele gids voor aandachtsvarianten in moderne LLM's

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Dit artikel biedt een visueel overzicht van aandachtsmechanismen in moderne grote taalmodellen, van standaard multi-head attention (MHA) tot grouped-query attention (GQA), multi-head latent attention (MLA), sparse attention en hybride architecturen. Het wordt vergezeld door een LLM-architectuurgalerij met 45 items en poster-versies.
Sebastian Raschka heeft een visuele gids gepubliceerd over attention-varianten in moderne LLM’s, samen met een galerij van 45 LLM-architecturen. Het artikel behandelt multi-head attention (MHA), de historische context ervan, en grouped-query attention (GQA), dat KV-cachekosten verlaagt door key-value-koppen te delen. GQA is een populaire afweging tussen efficiëntie en kwaliteit. Multi-head latent attention (MLA), gebruikt in DeepSeek V3, comprimeert de cache agressiever terwijl het betere prestaties behoudt. Het artikel bespreekt ook sparse attention en hybride architecturen, en bevat voorbeeldmodellen voor elke variant. Een posterversie is beschikbaar via Redbubble.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws