⚡ BREAKING
MallitTutkimus 🇺🇸 27.07.2026 17:03

DeepSeek V3:sta V3.2:een – arkkitehtuuri, harva huomio ja RL-päivitykset

DeepSeekDeepSeek
DeepSeek julkaisi V3.2:n, avoimen painoisten lippulaivamallin, jonka suorituskyky on verrattavissa GPT-5:een ja Gemini 3.0 Pro:hun. Malli esittelee DeepSeek Sparse Attention (DSA) -mekanismin tehokkuuden parantamiseksi, ja kehittyy omistautuneesta päättelymallista (R1) hybridipäättelymalliksi (V3.1, V3.2). Aikajana sisältää versiot V3, R1, R1-0528, V3.1, V3.2-Exp ja V3.2, ja arkkitehtuurin kohokohtia ovat Multi-Head Latent Attention (MLA) ja RLVR-koulutus.
DeepSeek V3.2, joka julkaistiin yhdysvaltalaisen lomaviikonlopun aikana, vastaa suorituskyvyltään GPT-5:tä ja Gemini 3.0 Prota, ja se on avoimen painoinen. Se perustuu V3.1:een, joka lisäsi V3-pohjaan hybridipäättelyn (ohjaus- ja päättelytilat). Keskeinen uusi ominaisuus on DeepSeek Sparse Attention (DSA), opittu harva huomiointimekanismi, jossa on salamanopea indeksoija ja token-valitsin, mikä parantaa tehokkuutta erityisesti pitkissä konteksteissa. DSA korvaa liukuvan ikkunan huomioinnin valitsemalla dynaamisesti, mihin aiempiin tokeneihin kiinnitetään huomiota. V3.2-Exp (syyskuu 2025) oli kokeellinen julkaisu infrastruktuurin valmistelemiseksi V3.2:ta varten. Aiemmat mallit: V3 (joulukuu 2024) käytti MoE:tä ja MLA:ta; R1 (tammikuu 2025) lisäsi päättelyn RLVR:n ja GRPO:n avulla; R1-0528 oli pieni päivitys. Yritys ilmeisesti vaihtoi NVIDIA-siruista Huawei-siruihin ja takaisin NVIDIAan. V3.2-julkaisu pyrkii monipuoliseksi hybridimalliksi, kun taas erillinen R2 saattaa olla vielä kehitteillä.
Lähde: Sebastian Raschka — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset