Von DeepSeek V3 bis V3.2: Architektur, Sparse Attention und RL-Updates
DeepSeek hat V3.2 veröffentlicht, ein Open-Weight-Flaggschiffmodell mit Leistung vergleichbar zu GPT-5 und Gemini 3.0 Pro. Das Modell führt DeepSeek Sparse Attention (DSA) für Effizienz ein und entwickelt sich von einem dedizierten Reasoning-Modell (R1) zu einem hybriden Reasoning-Modell (V3.1, V3.2). Der Zeitplan umfasst V3, R1, R1-0528, V3.1, V3.2-Exp und V3.2, mit architektonischen Höhepunkten wie Multi-Head Latent Attention (MLA) und RLVR-Training.
DeepSeek





