ForschungModelle 🇺🇸 27.07.2026 17:04

Jenseits der Standard-LLMs: Lineare Attention-Hybride, Textdiffusion, Code-World-Modelle und kleine rekursive Transformer

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
Der Artikel von Sebastian Raschka untersucht Alternativen zu standardmäßigen autoregressiven Transformer-LLMs, darunter lineare Attention-Hybride (z.B. MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-World-Modelle und kleine rekursive Transformer. Er diskutiert die Wiederbelebung linearer Attention-Mechanismen und Herausforderungen, wie etwa dass MiniMax in seinem M2-Modell aufgrund schwacher Leistung bei Denkaufgaben zur Standard-Attention zurückkehrte.
Sebastian Raschka diskutiert Alternativen zu standardmäßigen autoregressiven Decoder-Transformern, die auf Multi-Head Attention basieren. Zu den bemerkenswerten Modellen gehören MiniMax-M1 mit Lightning Attention, Qwen3-Next mit Gated DeltaNet und Gated Attention, DeepSeek V3.2 mit Spars Attention sowie Kimi Linear. Allerdings kehrte MiniMax bei seinem M2-Modell zur regulären Attention zurück, da die Genauigkeit bei Reasoning- und Multi-Turn-Aufgaben schlecht war. Qwen3-Next und Kimi Linear verwenden ein Verhältnis von 3:1 zwischen Linear Attention (Gated DeltaNet) und Full Attention (Gated Attention). Gated DeltaNet kombiniert Mamba2 mit einer Delta-Regel für rekursive Zustandsaktualisierungen. Der Artikel erwähnt auch andere Alternativen wie Textdiffusionsmodelle, Code-World-Modelle und kleine rekursive Transformer, geht aber nicht näher darauf ein.
Quelle: Sebastian Raschka — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten