Comparação de Arquiteturas de Grandes Modelos de Linguagem: Do DeepSeek V3 ao OLMo 2
DeepSeek
Allen Institute for AI
Sebastian Raschka publicou uma comparação detalhada das arquiteturas de LLMs abertos modernos, destacando inovações-chave: Multi-Head Latent Attention (MLA) e Mixture-of-Experts (MoE) no DeepSeek V3, além de características de normalização no OLMo 2. O artigo aborda a evolução do GPT-2 até modelos de 2025.
Sebastian Raschka apresentou uma visão geral das soluções arquitetônicas em grandes modelos de linguagem abertos modernos, focando nas capacidades textuais e deixando a multimodalidade de fora do artigo. Na seção sobre DeepSeek V3/R1, dois componentes-chave são detalhados: Multi-Head Latent Attention (MLA) e Mixture-of-Experts (MoE). O MLA comprime os tensores de chaves e valores em um espaço de menor dimensão antes de armazená-los no cache KV, reduzindo o uso de memória, e depois os restaura durante a inferência; de acordo com estudos de ablação do artigo DeepSeek-V2, o MLA apresenta melhor qualidade de modelagem do que o Grouped-Query Attention (GQA). O MoE no DeepSeek V3 usa 256 especialistas por módulo, dos quais apenas 9 estão ativos (um especialista geral e oito selecionados pelo roteador), permitindo que o modelo com 671 bilhões de parâmetros utilize apenas 37 bilhões por etapa de inferência. Na seção sobre OLMo 2, observa-se que o modelo do Allen Institute for AI se destaca pela transparência e usa o tradicional Multi-Head Attention (MHA) em vez de MLA ou GQA. A principal diferença arquitetônica do OLMo 2 é a disposição das camadas de normalização: ele aplica Post-Norm (RMSNorm após os subníveis de atenção e FeedForward), ao contrário do Pre-Norm mais comum, o que, segundo pesquisas, melhora a convergência dos gradientes na inicialização.
Fonte: Sebastian Raschka —
original
