शोधमॉडल 🇺🇸 27.07.2026 18:04

New DeepSeek-V3 Technical Report: How Hardware-Software Codesign Enables Low-Cost Training of Large Models

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
A new 14-page technical report from the DeepSeek-V3 team, co-authored by DeepSeek CEO Wenfeng Liang, has been released. The document analyzes the scaling challenges of large language models and the role of hardware infrastructure, proposing solutions based on joint design of models and hardware for cost-effective training and inference.
डीपसीक-वी3 टीम ने एक नई तकनीकी रिपोर्ट जारी की है, जिसमें कंपनी के सीईओ वेनफेंग लियांग को सह-लेखक के रूप में शामिल किया गया है। 14 पृष्ठों का यह दस्तावेज़ बड़ी भाषा मॉडल (large language models, LLM) के स्केलिंग से जुड़ी समस्याओं और हार्डवेयर बाधाओं को समर्पित है। पिछले प्रकाशन के विपरीत, जिसमें वी3 आर्किटेक्चर का वर्णन किया गया था, नई रिपोर्ट मॉडल विकास और इसके हार्डवेयर के बीच संबंधों पर केंद्रित है। डीपसीक-वी3 को 2048 एनवीआईडीआईए (NVIDIA) H800 जीपीयू के क्लस्टर पर प्रशिक्षित किया गया था और यह एक उदाहरण है कि कैसे 'हार्डवेयर' विशेषताओं को ध्यान में रखते हुए बाधाओं को दूर किया जा सकता है - मेमोरी की कमी, कम्प्यूटेशनल दक्षता और इंटरकनेक्ट बैंडविड्थ। प्रमुख आर्किटेक्चरल निर्णयों में मल्टी-हेड लेटेंट अटेंशन (Multi-head Latent Attention, MLA) तंत्र शामिल है, जो की-वैल्यू कैश को प्रति टोकन 70 केबी तक संपीड़ित करता है (जबकि LLaMA-3.1 405B में 516 केबी और Qwen-2.5 72B में 327 केबी है)। कम्प्यूटेशन बचत डीपसीकमोई (DeepSeekMoE) की स्पार्स आर्किटेक्चर के माध्यम से प्राप्त की जाती है: 671 बिलियन पैरामीटर वाला मॉडल प्रति टोकन केवल 37 बिलियन को सक्रिय करता है, जिसके लिए प्रति टोकन लगभग 250 GFLOPS की आवश्यकता होती है, जबकि Qwen-2.5 72B में 394 GFLOPS और LLaMA-3.1 405B में 2448 GFLOPS है। अनुमान को गति देने के लिए, एक डुअल माइक्रोबैच आर्किटेक्चर का उपयोग किया जाता है जो कम्युनिकेशन को कम्प्यूटेशन के साथ ओवरलैप करता है, साथ ही प्रीफिल (prefill) और डिकोड (decode) चरणों में विभाजन भी किया जाता है। डीपसीक-वी3 पहला सार्वजनिक रूप से ज्ञात बड़ा मॉडल बन गया है जिसे FP8 मिक्स्ड-प्रिसिजन का उपयोग करके प्रशिक्षित किया गया, जिससे कम्प्यूटेशनल लागत कम हुई। अंतर-नोड संचार के लिए, डेटा को FP8 (LogFMT) का उपयोग करके संपीड़ित किया जाता है, जिससे कम्युनिकेशन वॉल्यूम आधा हो जाता है। नियामक बाधाओं के कारण, NVIDIA H800 में NVLink बैंडविड्थ आधी है (900 के मुकाबले 400 जीबी/सेकंड), इसलिए डीपसीक ने एक 'नोड-केंद्रित रूटिंग' MoE विशेषज्ञों को लागू किया, जिसमें विशेषज्ञों को प्रति नोड 8 समूहों में 32 के साथ समूहित किया जाता है और प्रत्येक टोकन के लिए प्राप्त करने वाले नोड्स की संख्या चार तक सीमित होती है। दस्तावेज़ में भविष्य की दिशाओं पर भी चर्चा की गई है: स्केल-अप और स्केल-आउट को एक एकल बस (UB) में संयोजित करना, नेटवर्क ट्रैफ़िक के लिए विशेष कोप्रोसेसरों को शामिल करना, NVLink/PCIe बैंडविड्थ का गतिशील प्रबंधन और मल्टी-प्लेन फैट-ट्री टोपोलॉजी का उपयोग करना।
स्रोत: Synced — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार