ForschungModelle 🇺🇸 28.07.2026 15:05

Ein visueller Leitfaden zu Attention-Varianten in modernen LLMs

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Dieser Artikel bietet eine visuelle Übersicht über Aufmerksamkeitsmechanismen in modernen großen Sprachmodellen, die von standardmäßiger Multi-Head-Attention (MHA) über Grouped-Query Attention (GQA), Multi-Head Latent Attention (MLA), sparse Attention bis hin zu hybriden Architekturen reicht. Begleitet wird er von einer LLM-Architektur-Galerie mit 45 Einträgen und Posterversionen.
Sebastian Raschka hat einen visuellen Leitfaden zu Aufmerksamkeitsvarianten in modernen LLMs veröffentlicht, zusammen mit einer Galerie von 45 LLM-Architekturen. Der Artikel behandelt Multi-Head Attention (MHA), ihren historischen Kontext und Grouped-Query Attention (GQA), die die KV-Cache-Kosten durch gemeinsame Nutzung von Key-Value-Heads reduziert. GQA ist ein beliebter Kompromiss zwischen Effizienz und Qualität. Multi-Head Latent Attention (MLA), die in DeepSeek V3 verwendet wird, komprimiert den Cache aggressiver bei gleichzeitig besserer Leistung. Der Artikel diskutiert auch sparse Attention und hybride Architekturen und enthält Beispielmodelle für jede Variante. Eine Posterversion ist über Redbubble erhältlich.
Quelle: Sebastian Raschka — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten