Más allá de los LLM estándar: híbridos de atención lineal, difusión de texto, modelos del mundo de código y transformers recursivos pequeños
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
El artículo de Sebastian Raschka explora alternativas a los LLM transformer autorregresivos estándar, incluidos los híbridos de atención lineal (por ejemplo, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusión de texto, modelos del mundo de código y transformers recursivos pequeños. Se discute el renacimiento de los mecanismos de atención lineal y los desafíos, como que MiniMax volvió a la atención estándar en su modelo M2 debido al bajo rendimiento en tareas de razonamiento.
Sebastian Raschka analiza alternativas a los transformadores estándar de tipo decodificador autorregresivo, que se basan en atención de múltiples cabezas. Entre los modelos notables se incluyen MiniMax-M1 con atención relámpago, Qwen3-Next con Gated DeltaNet y Gated Attention, DeepSeek V3.2 con atención dispersa y Kimi Linear. Sin embargo, MiniMax volvió a la atención regular en su modelo M2, citando una precisión deficiente en tareas de razonamiento y de múltiples turnos. Qwen3-Next y Kimi Linear utilizan una proporción de 3:1 de atención lineal (Gated DeltaNet) a atención completa (Gated Attention). Gated DeltaNet combina Mamba2 con una regla delta para actualizaciones de estado recurrentes. El artículo también menciona otras alternativas, como modelos de difusión de texto, modelos de mundo de código y pequeños transformadores recursivos, pero no las detalla.
Fuente: Sebastian Raschka —
original
