Comparação de Arquiteturas de Grandes Modelos de Linguagem: Do DeepSeek V3 ao OLMo 2
Sebastian Raschka publicou uma comparação detalhada das arquiteturas de LLMs abertos modernos, destacando inovações-chave: Multi-Head Latent Attention (MLA) e Mixture-of-Experts (MoE) no DeepSeek V3, além de características de normalização no OLMo 2. O artigo aborda a evolução do GPT-2 até modelos de 2025.
DeepSeek
Allen Institute for AI











