PesquisaModelos 🇺🇸 27.07.2026 17:04

Além dos LLMs Padrão: Híbridos de Atenção Linear, Difusão de Texto, Modelos de Mundo de Código e Pequenos Transformers Recursivos

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
O artigo de Sebastian Raschka explora alternativas aos LLMs transformadores autorregressivos padrão, incluindo híbridos de atenção linear (por exemplo, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusão de texto, modelos de mundo de código e pequenos transformadores recursivos. Discute o renascimento dos mecanismos de atenção linear e desafios, como a MiniMax revertendo para atenção padrão em seu modelo M2 devido ao baixo desempenho em tarefas de raciocínio.
Sebastian Raschka discute alternativas aos transformers decodificadores autorregressivos padrão, que são construídos sobre atenção multicabeça. Modelos notáveis incluem MiniMax-M1 com atenção relâmpago, Qwen3-Next com Gated DeltaNet e Gated Attention, DeepSeek V3.2 com atenção esparsa e Kimi Linear. No entanto, a MiniMax reverteu para atenção regular em seu modelo M2, citando baixa precisão em tarefas de raciocínio e multiturnos. Qwen3-Next e Kimi Linear usam uma proporção de 3:1 de atenção linear (Gated DeltaNet) para atenção total (Gated Attention). O Gated DeltaNet combina Mamba2 com uma regra delta para atualizações recorrentes de estado. O artigo também menciona outras alternativas, como modelos de difusão de texto, modelos de mundo de código e pequenos transformers recursivos, mas não os detalha.
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas