InvestigaciónModelos 🇺🇸 27.07.2026 17:04

Más allá de los LLM estándar: híbridos de atención lineal, modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
El artículo explora alternativas a los LLM estándar basados en transformers autorregresivos: híbridos de atención lineal (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes. El autor señala un retorno a la atención clásica en MiniMax-M2 y la complejidad de la atención lineal en producción.
El autor, Sebastian Raschka, analiza alternativas a los LLM (modelos de lenguaje de gran tamaño) autorregresivos estándar basados en transformers con mecanismo de atención. Entre los enfoques examinados se encuentran los híbridos de atención lineal, que últimamente están viviendo un resurgimiento. Entre ellos figuran MiniMax-M1 (456B de parámetros, MoE —mezcla de expertos—, con lightning attention), Qwen3-Next (que emplea Gated DeltaNet y Gated Attention en una proporción de 3:1), DeepSeek V3.2 (atención dispersa, complejidad sublineal) y Kimi Linear (también con Gated DeltaNet). Sin embargo, MiniMax-M2 volvió a la atención estándar debido a problemas de precisión en tareas de razonamiento y en escenarios multitarea. También se mencionan los modelos de difusión de texto, los modelos de mundo basados en código (por ejemplo, para generar el estado de un juego) y los transformers recurrentes pequeños (como un modelo de 1.5B de parámetros comparado con GPT-4 en análisis sintáctico).
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas