नया DeepSeek-V3 तकनीकी रिपोर्ट: हार्डवेयर-सॉफ्टवेयर सह-डिज़ाइन कैसे बड़े मॉडलों की कम लागत वाली ट्रेनिंग सक्षम बनाता है
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
DeepSeek टीम का एक नया तकनीकी पेपर, जिसमें सीईओ वेंफ़ेंग लियांग सह-लेखक हैं, बड़े भाषा मॉडल ट्रेनिंग लागत को कम करने के लिए हार्डवेयर-जागरूक मॉडल सह-डिज़ाइन की पड़ताल करता है। 2048 NVIDIA H800 GPU पर प्रशिक्षित DeepSeek-V3 को केस स्टडी के रूप में उपयोग करते हुए, पेपर मेमोरी दक्षता (MLA), स्पार्स संगणना (DeepSeekMoE), FP8 प्रशिक्षण और इंटरकनेक्ट-जागरूक रूटिंग में नवाचारों का विवरण देता है।
14 पृष्ठों के पेपर 'स्केलिंग चैलेंजेज एंड रिफ्लेक्शंस ऑन हार्डवेयर फॉर एआई आर्किटेक्चर्स' में विश्लेषण किया गया है कि हार्डवेयर की सीमाएं (मेमोरी, कंप्यूट, इंटरकनेक्ट बैंडविड्थ) एलएलएम डिजाइन को कैसे आकार देती हैं। डीपसीक-वी3 (DeepSeek-V3) मल्टी-हेड लेटेंट अटेंशन (Multi-head Latent Attention, यानी एमएलए) का उपयोग करके केवी कैश को प्रति टोकन 70 केबी तक संपीड़ित करता है, जबकि एलएलएएमए-3.1 405बी (LLaMA-3.1 405B) में यह 516 केबी है। इसका डीपसीकएमओई (DeepSeekMoE) आर्किटेक्चर प्रति टोकन 671 बिलियन पैरामीटरों में से केवल 37 बिलियन को सक्रिय करता है, जिससे प्रति टोकन फ्लॉप्स (FLOPs) घटकर लगभग 250 गीगाफ्लॉप्स हो जाते हैं, जबकि क्यूवेन2.5-72बी (Qwen2.5-72B) में यह 394 और एलएलएएमए-3.1 405बी में 2448 है। मॉडल एफपी8 (FP8) मिश्रित-परिशुद्धता प्रशिक्षण और लॉगएफएमटी (LogFMT) निम्न-परिशुद्धता संचार का उपयोग करता है, जो बीएफ16 (BF16) की तुलना में संचार मात्रा को 50% तक कम करता है। एनवीआईडीआईए एच800 (NVIDIA H800) की कम एनवीलिंक (NVLink) बैंडविड्थ (एच100 में 900 गीगाबाइट प्रति सेकंड के मुकाबले 400 गीगाबाइट प्रति सेकंड) को कम करने के लिए, नोड-अवेयर रूटिंग 256 एक्सपर्ट्स को 8 नोड-स्थानीय समूहों में बांटती है, जिससे प्रत्येक टोकन अधिकतम 4 नोड्स तक सीमित रहता है। पेपर एकीकृत स्केल-अप/स्केल-आउट इंटरकनेक्ट और समर्पित संचार सहप्रोसेसरों की वकालत करता है।
स्रोत: Synced —
मूल
