PesquisaModelos 🇺🇸 28.07.2026 15:05

Um Guia Visual para Variantes de Atenção em LLMs Modernos

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
Este artigo fornece uma visão geral visual dos mecanismos de atenção em grandes modelos de linguagem modernos, cobrindo desde a atenção multi-cabeça padrão (MHA) até a atenção de consulta agrupada (GQA), atenção latente multi-cabeça (MLA), atenção esparsa e arquiteturas híbridas. É acompanhado por uma galeria de arquiteturas de LLM com 45 entradas e versões em pôster.
Sebastian Raschka publicou um guia visual sobre variantes de atenção em LLMs modernos, junto com uma galeria de 45 arquiteturas de LLM. O artigo aborda a atenção multi-cabeça (Multi-Head Attention, MHA), seu contexto histórico, e a atenção de consulta agrupada (Grouped-Query Attention, GQA), que reduz os custos do cache KV ao compartilhar cabeças chave-valor. A GQA é um compromisso popular entre eficiência e qualidade. A atenção latente multi-cabeça (Multi-Head Latent Attention, MLA), usada no DeepSeek V3, comprime o cache de forma mais agressiva, mantendo melhor desempenho. O artigo também discute atenção esparsa e arquiteturas híbridas, e inclui modelos de exemplo para cada variante. Uma versão em pôster está disponível via Redbubble.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas