Más allá de los LLM estándar: híbridos de atención lineal, modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes
El artículo explora alternativas a los LLM estándar basados en transformers autorregresivos: híbridos de atención lineal (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusión de texto, modelos de mundo de código y pequeños transformers recurrentes. El autor señala un retorno a la atención clásica en MiniMax-M2 y la complejidad de la atención lineal en producción.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA

