Ein visueller Leitfaden zu Attention-Varianten in modernen LLMs
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Dieser Artikel bietet eine visuelle Übersicht über Aufmerksamkeitsmechanismen in modernen großen Sprachmodellen, die von standardmäßiger Multi-Head-Attention (MHA) über Grouped-Query Attention (GQA), Multi-Head Latent Attention (MLA), sparse Attention bis hin zu hybriden Architekturen reicht. Begleitet wird er von einer LLM-Architektur-Galerie mit 45 Einträgen und Posterversionen.
Sebastian Raschka hat einen visuellen Leitfaden zu Aufmerksamkeitsvarianten in modernen LLMs veröffentlicht, zusammen mit einer Galerie von 45 LLM-Architekturen. Der Artikel behandelt Multi-Head Attention (MHA), ihren historischen Kontext und Grouped-Query Attention (GQA), die die KV-Cache-Kosten durch gemeinsame Nutzung von Key-Value-Heads reduziert. GQA ist ein beliebter Kompromiss zwischen Effizienz und Qualität. Multi-Head Latent Attention (MLA), die in DeepSeek V3 verwendet wird, komprimiert den Cache aggressiver bei gleichzeitig besserer Leistung. Der Artikel diskutiert auch sparse Attention und hybride Architekturen und enthält Beispielmodelle für jede Variante. Eine Posterversion ist über Redbubble erhältlich.
Quelle: Sebastian Raschka —
Original
