InvestigaciónModelos 🇺🇸 28.07.2026 15:05

Guía visual de las variantes de atención en los LLM modernos

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Este artículo ofrece una visión general visual de los mecanismos de atención en los grandes modelos de lenguaje modernos, cubriendo desde la atención multi-cabeza estándar (MHA) hasta la atención de consulta agrupada (GQA), la atención latente multi-cabeza (MLA), la atención dispersa y las arquitecturas híbridas. Se acompaña de una galería de arquitecturas de LLM con 45 entradas y versiones en póster.
Sebastian Raschka publicó una guía visual sobre las variantes de atención en los LLM modernos, junto con una galería de 45 arquitecturas de LLM. El artículo cubre la atención de múltiples cabezas (MHA, por sus siglas en inglés), su contexto histórico y la atención de consulta agrupada (GQA, por sus siglas en inglés), que reduce los costos de la caché KV al compartir las cabezas clave-valor. GQA es un compromiso popular entre eficiencia y calidad. La atención de múltiples cabezas latente (MLA, por sus siglas en inglés), utilizada en DeepSeek V3, comprime la caché de manera más agresiva mientras mantiene un mejor rendimiento. El artículo también analiza la atención dispersa y las arquitecturas híbridas, e incluye modelos de ejemplo para cada variante. Hay disponible una versión en póster a través de Redbubble.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas