Além dos LLMs Padrão: Híbridos de Atenção Linear, Modelos de Difusão de Texto, Modelos de Mundo de Código e Pequenos Transformers Recorrentes
O artigo explora alternativas aos LLMs padrão baseados em transformers autorregressivos: híbridos de atenção linear (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusão de texto, modelos de mundo de código e pequenos transformers recorrentes. O autor observa um retorno à atenção clássica no MiniMax-M2 e a complexidade da atenção linear em produção.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA



