⚡ BREAKING
मॉडलशोध 🇺🇸 27.07.2026 17:03

DeepSeek V3 से V3.2 तक: आर्किटेक्चर, स्पार्स अटेंशन और RL अपडेट्स

DeepSeekDeepSeek
DeepSeek ने V3.2 जारी किया, जो एक ओपन-वेट फ्लैगशिप मॉडल है जिसका प्रदर्शन GPT-5 और Gemini 3.0 Pro के बराबर है। मॉडल दक्षता के लिए DeepSeek Sparse Attention (DSA) प्रस्तुत करता है, और एक समर्पित रीज़निंग मॉडल (R1) से हाइब्रिड रीज़निंग मॉडल (V3.1, V3.2) में विकसित होता है। समयरेखा में V3, R1, R1-0528, V3.1, V3.2-Exp और V3.2 शामिल हैं, जिसमें मल्टी-हेड लेटेंट अटेंशन (MLA) और RLVR प्रशिक्षण जैसी आर्किटेक्चरल हाइलाइट्स हैं।
अमेरिकी छुट्टी के सप्ताहांत पर जारी किया गया DeepSeek V3.2 मॉडल, GPT-5 और Gemini 3.0 Pro के प्रदर्शन से मेल खाता है, जबकि यह ओपन-वेट है। यह V3.1 पर आधारित है, जिसने V3 बेस में हाइब्रिड रीज़निंग (इंस्ट्रक्ट और रीज़निंग मोड) जोड़ा था। मुख्य नई सुविधा DeepSeek Sparse Attention (DSA) है, जो एक सीखा हुआ स्पार्स अटेंशन मैकेनिज्म है, जिसमें लाइटनिंग इंडेक्सर और टोकन सेलेक्टर शामिल है; यह दक्षता बढ़ाता है, विशेष रूप से लंबे कॉन्टेक्स्ट के लिए। DSA स्लाइडिंग-विंडो अटेंशन को बदलकर गतिशील रूप से चुनता है कि अतीत के किन टोकनों पर ध्यान देना है। V3.2-Exp (सितंबर 2025) V3.2 के लिए बुनियादी ढांचा तैयार करने हेतु एक प्रयोगात्मक रिलीज़ था। पिछले मॉडल: V3 (दिसंबर 2024) ने MoE और MLA का उपयोग किया; R1 (जनवरी 2025) ने GRPO के साथ RLVR के माध्यम से रीज़निंग जोड़ी; R1-0528 एक छोटा अपग्रेड था। कंपनी ने कथित तौर पर NVIDIA चिप्स से Huawei चिप्स और वापस NVIDIA पर स्विच किया। V3.2 रिलीज़ का उद्देश्य एक बहुमुखी हाइब्रिड मॉडल है, जबकि एक समर्पित R2 अभी भी विकासाधीन हो सकता है।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार