Modern Büyük Dil Modellerinde Dikkat Varyantlarına Görsel Bir Kılavuz
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Bu makale, standart çok başlı dikkatten (multi-head attention - MHA), gruplanmış sorgu dikkatine (grouped-query attention - GQA), çok başlı gizli dikkate (multi-head latent attention - MLA), seyrek dikkate ve hibrit mimarilere kadar modern büyük dil modellerindeki dikkat mekanizmalarına görsel bir genel bakış sunmaktadır. Makaleye, 45 girişli bir büyük dil modeli mimarisi galerisi ve poster sürümleri eşlik etmektedir.
Sebastian Raschka, modern LLM'lerdeki dikkat varyantlarına görsel bir rehber ve 45 LLM mimarisinden oluşan bir galeri yayınladı. Makale, çok başlı dikkat (multi-head attention - MHA), tarihsel bağlamı ve anahtar-değer başlıklarını paylaşarak KV-önbellek maliyetlerini azaltan gruplandırılmış sorgu dikkatini (grouped-query attention - GQA) kapsıyor. GQA, verimlilik ve kalite arasında popüler bir denge sunuyor. DeepSeek V3'te kullanılan çok başlı gizli dikkat (multi-head latent attention - MLA) ise önbelleği daha agresif bir şekilde sıkıştırırken daha iyi performans sağlıyor. Makale ayrıca seyrek dikkat ve hibrit mimarileri ele alıyor ve her varyant için örnek modeller içeriyor. Poster versiyonu Redbubble üzerinden temin edilebilir.
Kaynak: Sebastian Raschka —
orijinal
