⚡ 速報
モデル研究 🇺🇸 27.07.2026 17:03

DeepSeek V3からV3.2へ:アーキテクチャ、スパースアテンション、RLアップデート

DeepSeekDeepSeek
DeepSeekは、GPT-5やGemini 3.0 Proに匹敵する性能を持つオープンウェイトのフラッグシップモデルV3.2をリリースしました。このモデルは、効率性のためにDeepSeekスパースアテンション(DeepSeek Sparse Attention、DSA)を導入し、専用の推論モデル(R1)からハイブリッド推論モデル(V3.1、V3.2)へと進化しています。タイムラインにはV3、R1、R1-0528、V3.1、V3.2-Exp、V3.2が含まれ、マルチヘッド潜在アテンション(Multi-Head Latent Attention、MLA)やRLVRトレーニングといったアーキテクチャのハイライトがあります。
米国のホリデー週末にリリースされたDeepSeek V3.2は、オープンウェイトでありながらGPT-5やGemini 3.0 Proと同等のパフォーマンスを達成している。本モデルは、V3ベースにハイブリッド推論(指示モードと推論モード)を追加したV3.1をベースに発展したものである。主な新機能はDeepSeek Sparse Attention(DSA)で、学習されたスパースアテンションメカニズムにライトニングインデクサーとトークンセレクターを組み合わせ、特に長いコンテキストにおいて効率を向上させる。DSAはスライディングウィンドウアテンションを置き換え、過去のどのトークンに注目するかを動的に選択する。V3.2-Exp(2025年9月)は、V3.2のためのインフラを準備する実験的リリースであった。以前のモデル:V3(2024年12月)はMoEとMLAを採用。R1(2025年1月)はRLVRとGRPOを用いた推論を追加。R1-0528はマイナーアップグレードである。同社はNVIDIAからHuaweiチップに切り替え、再びNVIDIAに戻ったと伝えられている。V3.2のリリースは多用途のハイブリッドモデルを目指しており、専用のR2はまだ開発中である可能性がある。
出典: Sebastian Raschka — 原文
関連記事 ↓
新着ニュース