PesquisaModelos 🇺🇸 27.07.2026 17:04

Além dos LLMs Padrão: Híbridos de Atenção Linear, Modelos de Difusão de Texto, Modelos de Mundo de Código e Pequenos Transformers Recorrentes

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
O artigo explora alternativas aos LLMs padrão baseados em transformers autorregressivos: híbridos de atenção linear (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), modelos de difusão de texto, modelos de mundo de código e pequenos transformers recorrentes. O autor observa um retorno à atenção clássica no MiniMax-M2 e a complexidade da atenção linear em produção.
Автор, Себастьян Рашка, анализирует альтернативы стандартным авторегрессионным LLM на основе трансформеров с механизмом внимания. Среди рассмотренных подходов — линейные гибриды внимания, которые недавно переживают возрождение. К ним относятся MiniMax-M1 (456B параметров, MoE, с lightning attention), Qwen3-Next (использует Gated DeltaNet и Gated Attention в соотношении 3:1), DeepSeek V3.2 (разреженное внимание, сублинейная сложность) и Kimi Linear (также с Gated DeltaNet). Однако MiniMax-M2 вернулся к стандартному вниманию из-за проблем с точностью в задачах рассуждения и многозадачности. Также упоминаются текстовые диффузионные модели, кодовые модели мира (например, для генерации состояния игры) и малые рекуррентные трансформеры (как 1.5B модель, сравниваемая с GPT-4 на синтаксическом анализе).
Fonte: Sebastian Raschka — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas