Een visuele gids voor aandachtsvarianten in moderne LLM's
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Dit artikel geeft een visueel overzicht van aandachtsmechanismen in moderne grote taalmodellen, van standaard multi-head attention (MHA) tot grouped-query attention (GQA), multi-head latent attention (MLA), sparse attention en hybride architecturen. Het wordt begeleid door een galerij met LLM-architecturen met 45 vermeldingen en posterversies.
Sebastian Raschka heeft een visuele gids gepubliceerd over attention-varianten in moderne LLM’s, samen met een galerij van 45 LLM-architecturen. Het artikel behandelt multi-head attention (MHA), de historische context ervan, en grouped-query attention (GQA), dat KV-cachekosten verlaagt door key-value-koppen te delen. GQA is een populaire afweging tussen efficiëntie en kwaliteit. Multi-head latent attention (MLA), gebruikt in DeepSeek V3, comprimeert de cache agressiever terwijl het betere prestaties behoudt. Het artikel bespreekt ook sparse attention en hybride architecturen, en bevat voorbeeldmodellen voor elke variant. Een posterversie is beschikbaar via Redbubble.
Bron: Sebastian Raschka —
origineel
