Comparação de Arquiteturas de Grandes Modelos de Linguagem: Do DeepSeek V3 ao OLMo 2
DeepSeek
Allen Institute for AI
Sebastian Raschka compara as arquiteturas de LLMs modernos, incluindo o DeepSeek V3 com Multi-Head Latent Attention e Mixture-of-Experts, e o OLMo 2 do Allen Institute for AI com Post-Norm e QK-norm. O artigo aborda decisões arquiteturais importantes como Grouped-Query Attention e diversos esquemas de normalização.
Em seu artigo, Sebastian Raschka examina as características arquiteturais de grandes modelos de linguagem modernos, comparando DeepSeek V3/R1, OLMo 2 e outros. O DeepSeek V3 usa Multi-Head Latent Attention (MLA), que comprime chaves e valores em um espaço de baixa dimensionalidade para economizar memória de cache KV, e Mixture-of-Experts (MoE) com 256 especialistas, dos quais apenas 9 estão ativos (um especialista compartilhado e 8 selecionados pelo roteador), permitindo que ele utilize apenas 37 bilhões de parâmetros por etapa, apesar de ter 671 bilhões no total. O OLMo 2 do Allen Institute for AI, por outro lado, emprega Multi-Head Attention tradicional, mas com Post-Norm (RMSNorm após as camadas de atenção e rede feed-forward) e QK-norm para estabilizar o treinamento. O artigo também menciona Grouped-Query Attention como uma alternativa ao Multi-Head Attention usado em outros modelos.
Fonte: Sebastian Raschka —
original
