Comparación de arquitecturas de modelos de lenguaje grandes: desde DeepSeek V3 hasta OLMo 2
Sebastian Raschka publicó una comparación detallada de las arquitecturas de los LLM abiertos modernos, destacando innovaciones clave: Multi-Head Latent Attention (MLA) y Mixture-of-Experts (MoE) en DeepSeek V3, así como características de normalización en OLMo 2. El artículo cubre la evolución desde GPT-2 hasta los modelos de 2025.
DeepSeek
Allen Institute for AI











