⚡ EILMELDUNG
Von DeepSeek V3 bis V3.2: Architektur, Sparse Attention und RL-Updates
DeepSeek
DeepSeek hat V3.2 veröffentlicht, ein Open-Weight-Flaggschiffmodell mit Leistung vergleichbar zu GPT-5 und Gemini 3.0 Pro. Das Modell führt DeepSeek Sparse Attention (DSA) für Effizienz ein und entwickelt sich von einem dedizierten Reasoning-Modell (R1) zu einem hybriden Reasoning-Modell (V3.1, V3.2). Der Zeitplan umfasst V3, R1, R1-0528, V3.1, V3.2-Exp und V3.2, mit architektonischen Höhepunkten wie Multi-Head Latent Attention (MLA) und RLVR-Training.
DeepSeek V3.2, veröffentlicht über ein US-Feiertagswochenende, erreicht die Leistung von GPT-5 und Gemini 3.0 Pro und ist dabei open-weight. Es baut auf V3.1 auf, das dem V3-Basismodell hybrides Reasoning (Instruct- und Reasoning-Modi) hinzufügte. Die wichtigste Neuerung ist die DeepSeek Sparse Attention (DSA), ein gelernter Mechanismus für sparse Attention mit einem Lightning-Indexer und einem Token-Selektor, der die Effizienz insbesondere bei langen Kontexten verbessert. DSA ersetzt die Sliding-Window Attention, indem es dynamisch auswählt, auf welche vergangenen Tokens die Aufmerksamkeit gerichtet wird. V3.2-Exp (September 2025) war eine experimentelle Veröffentlichung zur Vorbereitung der Infrastruktur für V3.2. Frühere Modelle: V3 (Dezember 2024) nutzte MoE und MLA; R1 (Januar 2025) fügte Reasoning via RLVR mit GRPO hinzu; R1-0528 war ein kleineres Upgrade. Das Unternehmen wechselte Berichten zufolge von NVIDIA- zu Huawei-Chips und dann zurück zu NVIDIA. Die V3.2-Veröffentlichung zielt auf ein vielseitiges hybrides Modell ab, während ein dediziertes R2 möglicherweise noch in Entwicklung ist.
Quelle: Sebastian Raschka —
Original
