Forschung RSS

Forschung 🇺🇸

Jenseits der Standard-LLMs: Lineare Attention-Hybride, Textdiffusion, Code-World-Modelle und kleine rekursive Transformer

Der Artikel von Sebastian Raschka untersucht Alternativen zu standardmäßigen autoregressiven Transformer-LLMs, darunter lineare Attention-Hybride (z.B. MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), Textdiffusionsmodelle, Code-World-Modelle und kleine rekursive Transformer. Er diskutiert die Wiederbelebung linearer Attention-Mechanismen und Herausforderungen, wie etwa dass MiniMax in seinem M2-Modell aufgrund schwacher Leistung bei Denkaufgaben zur Standard-Attention zurückkehrte.

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face
Sebastian Raschka27.07 · 17:04
Modelle 🇺🇸

Von DeepSeek V3 bis V3.2: Architektur, Sparse Attention und RL-Updates

DeepSeek hat V3.2 veröffentlicht, ein Open-Weight-Flaggschiffmodell mit Leistung vergleichbar zu GPT-5 und Gemini 3.0 Pro. Das Modell führt DeepSeek Sparse Attention (DSA) für Effizienz ein und entwickelt sich von einem dedizierten Reasoning-Modell (R1) zu einem hybriden Reasoning-Modell (V3.1, V3.2). Der Zeitplan umfasst V3, R1, R1-0528, V3.1, V3.2-Exp und V3.2, mit architektonischen Höhepunkten wie Multi-Head Latent Attention (MLA) und RLVR-Training.

DeepSeekDeepSeek
Sebastian Raschka27.07 · 17:03
Aktuelle Nachrichten