Más allá de los LLM estándar: híbridos de atención lineal, modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
El artículo explora alternativas a los LLM estándar basados en transformers autorregresivos: híbridos de atención lineal (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes. El autor señala un retorno a la atención clásica en MiniMax-M2 y la complejidad de la atención lineal en producción.
El autor, Sebastian Raschka, analiza alternativas a los LLM (modelos de lenguaje de gran tamaño) autorregresivos estándar basados en transformers con mecanismo de atención. Entre los enfoques examinados se encuentran los híbridos de atención lineal, que últimamente están viviendo un resurgimiento. Entre ellos figuran MiniMax-M1 (456B de parámetros, MoE —mezcla de expertos—, con lightning attention), Qwen3-Next (que emplea Gated DeltaNet y Gated Attention en una proporción de 3:1), DeepSeek V3.2 (atención dispersa, complejidad sublineal) y Kimi Linear (también con Gated DeltaNet). Sin embargo, MiniMax-M2 volvió a la atención estándar debido a problemas de precisión en tareas de razonamiento y en escenarios multitarea. También se mencionan los modelos de difusión de texto, los modelos de mundo basados en código (por ejemplo, para generar el estado de un juego) y los transformers recurrentes pequeños (como un modelo de 1.5B de parámetros comparado con GPT-4 en análisis sintáctico).
Fuente: Sebastian Raschka —
original
