Um Guia Visual para Variantes de Atenção em LLMs Modernos
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
Este artigo fornece uma visão geral visual dos mecanismos de atenção em grandes modelos de linguagem modernos, cobrindo desde a atenção multi-cabeça padrão (MHA) até a atenção de consulta agrupada (GQA), atenção latente multi-cabeça (MLA), atenção esparsa e arquiteturas híbridas. É acompanhado por uma galeria de arquiteturas de LLM com 45 entradas e versões em pôster.
Sebastian Raschka publicou um guia visual sobre variantes de atenção em LLMs modernos, junto com uma galeria de 45 arquiteturas de LLM. O artigo aborda a atenção multi-cabeça (Multi-Head Attention, MHA), seu contexto histórico, e a atenção de consulta agrupada (Grouped-Query Attention, GQA), que reduz os custos do cache KV ao compartilhar cabeças chave-valor. A GQA é um compromisso popular entre eficiência e qualidade. A atenção latente multi-cabeça (Multi-Head Latent Attention, MLA), usada no DeepSeek V3, comprime o cache de forma mais agressiva, mantendo melhor desempenho. O artigo também discute atenção esparsa e arquiteturas híbridas, e inclui modelos de exemplo para cada variante. Uma versão em pôster está disponível via Redbubble.
Fonte: Sebastian Raschka —
original
