ModelosInvestigación 🇺🇸 27.07.2026 18:04

Comparación de arquitecturas de modelos de lenguaje grandes: desde DeepSeek V3 hasta OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka publicó una comparación detallada de las arquitecturas de los LLM abiertos modernos, destacando innovaciones clave: Multi-Head Latent Attention (MLA) y Mixture-of-Experts (MoE) en DeepSeek V3, así como características de normalización en OLMo 2. El artículo cubre la evolución desde GPT-2 hasta los modelos de 2025.
Sebastián Raschka presentó una revisión de las soluciones arquitectónicas en los modelos modernos de lenguaje grandes y abiertos, centrándose en las capacidades de texto y dejando la multimodalidad fuera del alcance del artículo. En la sección sobre DeepSeek V3/R1, se analizan en detalle dos componentes clave: Multi-Head Latent Attention (MLA) y Mixture-of-Experts (MoE). MLA comprime los tensores de clave y valor en un espacio de menor dimensionalidad antes de almacenarlos en la caché KV, reduciendo el uso de memoria, y luego los restaura durante la inferencia; según los estudios de ablación del artículo de DeepSeek-V2, MLA muestra una mejor calidad de modelado que Grouped-Query Attention (GQA). MoE en DeepSeek V3 utiliza 256 expertos por módulo, de los cuales solo 9 están activos (uno común y ocho seleccionados por el enrutador), lo que permite que el modelo con 671 mil millones de parámetros utilice solo 37 mil millones por paso de inferencia. En la sección sobre OLMo 2, se señala que el modelo del Allen Institute for AI es notable por su transparencia y utiliza la atención Multi-Head Attention (MHA) tradicional en lugar de MLA o GQA. La diferencia arquitectónica clave de OLMo 2 es la ubicación de las capas de normalización: aplica Post-Norm (RMSNorm después de los subniveles de atención y FeedForward), a diferencia del Pre-Norm más común, lo que, según estudios, mejora la convergencia de los gradientes durante la inicialización.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas