Guide Visuel des Variantes d'Attention dans les LLM Modernes
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Cet article propose un aperçu visuel des mécanismes d'attention dans les grands modèles de langage modernes, couvrant de l'attention multi-tête standard (MHA) à l'attention par requêtes groupées (GQA), l'attention latente multi-tête (MLA), l'attention sparse et les architectures hybrides. Il est accompagné d'une galerie d'architectures LLM avec 45 entrées et des versions poster.
Sebastian Raschka a publié un guide visuel des variantes d'attention dans les LLM modernes, accompagné d'une galerie de 45 architectures de LLM. L'article couvre l'attention multi-tête (MHA), son contexte historique, et l'attention à requêtes groupées (GQA) qui réduit les coûts du cache KV en partageant les têtes clé-valeur. GQA est un compromis populaire entre efficacité et qualité. L'attention latente multi-tête (MLA), utilisée dans DeepSeek V3, comprime le cache plus agressivement tout en maintenant de meilleures performances. L'article aborde également l'attention sparse et les architectures hybrides, et inclut des exemples de modèles pour chaque variante. Une version poster est disponible via Redbubble.
Source: Sebastian Raschka —
original
