⚡ BREAKING
Dari DeepSeek V3 ke V3.2: Arsitektur, Sparse Attention, dan Pembaruan RL
DeepSeek
DeepSeek merilis V3.2, model flagship open-weight dengan kinerja sebanding dengan GPT-5 dan Gemini 3.0 Pro. Model ini memperkenalkan DeepSeek Sparse Attention (DSA) untuk efisiensi, dan berevolusi dari model penalaran khusus (R1) menjadi model penalaran hybrid (V3.1, V3.2). Garis waktu meliputi V3, R1, R1-0528, V3.1, V3.2-Exp, dan V3.2, dengan sorotan arsitektur seperti Multi-Head Latent Attention (MLA) dan pelatihan RLVR.
DeepSeek V3.2, yang dirilis selama akhir pekan liburan di AS, menyamai performa GPT-5 dan Gemini 3.0 Pro sementara bobotnya terbuka. Model ini dibangun di atas V3.1, yang menambahkan penalaran hibrida (mode instruksi dan penalaran) ke basis V3. Fitur baru utamanya adalah DeepSeek Sparse Attention (DSA), sebuah mekanisme perhatian renggang yang dipelajari dengan indeks kilat dan pemilih token yang meningkatkan efisiensi, terutama untuk konteks panjang. DSA menggantikan perhatian jendela geser dengan secara dinamis memilih token masa lalu mana yang akan diperhatikan. V3.2-Exp (September 2025) adalah rilis eksperimental untuk mempersiapkan infrastruktur bagi V3.2. Model sebelumnya: V3 (Desember 2024) menggunakan MoE dan MLA; R1 (Januari 2025) menambahkan penalaran melalui RLVR dengan GRPO; R1-0528 adalah peningkatan kecil. Perusahaan dilaporkan beralih dari chip NVIDIA ke Huawei dan kembali ke NVIDIA. Rilis V3.2 bertujuan untuk model hibrida serbaguna, sementara R2 khusus mungkin masih dalam pengembangan.
Sumber: Sebastian Raschka —
asli
