Além dos LLMs Padrão: Híbridos de Atenção Linear, Difusão de Texto, Modelos de Mundo de Código e Pequenos Transformers Recursivos
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
O artigo de Sebastian Raschka explora alternativas aos LLMs transformadores autorregressivos padrão, incluindo híbridos de atenção linear (por exemplo, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusão de texto, modelos de mundo de código e pequenos transformadores recursivos. Discute o renascimento dos mecanismos de atenção linear e desafios, como a MiniMax revertendo para atenção padrão em seu modelo M2 devido ao baixo desempenho em tarefas de raciocínio.
Sebastian Raschka discute alternativas aos transformers decodificadores autorregressivos padrão, que são construídos sobre atenção multicabeça. Modelos notáveis incluem MiniMax-M1 com atenção relâmpago, Qwen3-Next com Gated DeltaNet e Gated Attention, DeepSeek V3.2 com atenção esparsa e Kimi Linear. No entanto, a MiniMax reverteu para atenção regular em seu modelo M2, citando baixa precisão em tarefas de raciocínio e multiturnos. Qwen3-Next e Kimi Linear usam uma proporção de 3:1 de atenção linear (Gated DeltaNet) para atenção total (Gated Attention). O Gated DeltaNet combina Mamba2 com uma regra delta para atualizações recorrentes de estado. O artigo também menciona outras alternativas, como modelos de difusão de texto, modelos de mundo de código e pequenos transformers recursivos, mas não os detalha.
Fonte: Sebastian Raschka —
original
