⚡ ÚLTIMA HORA
InvestigaciónModelos 🇺🇸 27.07.2026 13:06

Innovaciones en arquitectura de LLM: compartición de KV, embeddings por capa y atención comprimida

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Sebastian Raschka revisa los avances recientes en arquitecturas de modelos de lenguaje de gran escala (LLM) de peso abierto, centrándose en la eficiencia para contextos largos. Las técnicas clave incluyen la compartición de KV entre capas (Gemma 4), embeddings por capa (Gemma 4 E2B/E4B), presupuesto de atención por capa (Laguna XS.2), atención convolucional comprimida (ZAYA1) y mHC con atención comprimida (DeepSeek V4). Estas reducen el tamaño de la caché KV y el tráfico de memoria para flujos de trabajo de razonamiento y agentes.
Sebastian Raschka analiza las modificaciones recientes en la arquitectura de los modelos de peso abierto (open-weight LLMs) destinadas a reducir los costos en contextos largos. En Gemma 4 E2B/E4B, las capas posteriores reutilizan los estados clave-valor de capas anteriores (atención entre capas), ahorrando aproximadamente la mitad del tamaño de la caché KV (por ejemplo, 2.7 GB para un contexto de 128K). Además, estos modelos utilizan incrustaciones por capa (PLE) para aumentar la capacidad sin expandir la pila principal del transformador: el recuento 'efectivo' de parámetros es menor que el total incluyendo las incrustaciones. Laguna XS.2 de Poolside varía el costo de atención por capa, con 30 capas de ventana deslizante (ventana de 512) y 10 capas de atención completa. ZAYA1-8B introduce atención convolucional comprimida, y DeepSeek V4 emplea mHC y atención comprimida. Estos ajustes están motivados por la creciente necesidad de procesamiento eficiente de contextos largos en modelos de razonamiento y flujos de trabajo de agentes.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas