Jenseits der Standard-LLMs: Lineare Attention-Hybride, Textdiffusion, Code-World-Modelle und kleine rekursive Transformer
Der Artikel von Sebastian Raschka untersucht Alternativen zu standardmäßigen autoregressiven Transformer-LLMs, darunter lineare Attention-Hybride (z.B. MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-World-Modelle und kleine rekursive Transformer. Er diskutiert die Wiederbelebung linearer Attention-Mechanismen und Herausforderungen, wie etwa dass MiniMax in seinem M2-Modell aufgrund schwacher Leistung bei Denkaufgaben zur Standard-Attention zurückkehrte.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
