⚡ BREAKING

NVIDIA Groq 3: SRAM, Disaggregation, and Determinism in the New AI Platform

NVIDIANVIDIA GroqGroq
After acquiring Groq for $20 billion, NVIDIA integrated LPU accelerators into the Vera Rubin platform, creating a heterogeneous architecture for inference. The new Groq 3 LPX rack accelerator, based on Groq 3 LP30 chips with 500 MB of SRAM and 150 TB/s memory bandwidth, ensures deterministic execution and low latency. Phase-based disaggregation of decoding (AFD) allows separating FFN computations from attention, distributing the workload between GPUs and LPUs.
NVIDIA ने अपने इतिहास का सबसे बड़ा सौदा पूरा करते हुए Groq को 20 अरब डॉलर में अधिग्रहित कर लिया है, और अपने Vera Rubin प्लेटफॉर्म में आर्किटेक्चरली भिन्न AI त्वरक LPU को एकीकृत कर दिया है, जिससे इन्फ्रेंस में तेजी आई है, जो अब डीज़ग्रिगेटेड हो गया है और प्लेटफॉर्म हेटरोजीनियस हो गया है। नया रैक-माउंटेड त्वरक NVIDIA Groq 3 LPX, जिसकी बिजली खपत 160 किलोवाट है, में 256 Groq 3 AI चिप्स (LP30) शामिल हैं, जिनमें से प्रत्येक में 96 अरब ट्रांजिस्टर हैं। ये चिप्स 32 1U नोड्स में एकजुट हैं, जिनमें डायरेक्ट लिक्विड कूलिंग और MGX के साथ केबल-मुक्त डिज़ाइन है। Groq 3 LPU चिप SRAM मेमोरी पर बना है, जिसकी क्षमता 500 मेगाबाइट और बैंडविड्थ 150 टेराबाइट प्रति सेकंड है, बिना किसी कैश या पदानुक्रम के, जिससे कंपाइलर नियंत्रण में डेटा को स्पष्ट रूप से स्थानांतरित किया जा सकता है। LPU की निर्धारक विशेषता है डिटरमिनिज़्म - रनटाइम पर भिन्नता का अभाव, सभी निर्णय कंपाइलर को स्थानांतरित करने और प्लेज़ियोक्रोनस C2C प्रोटोकॉल का उपयोग करने के कारण। मुख्य नवाचार है फेज़्ड-डिकोडिंग डीज़ग्रिगेशन (AFD), जो GPU पर किए जाने वाले अटेंशन मैकेनिज्म को LPX पर प्रोसेस किए जाने वाले FFN/MoE ऑपरेशंस से अलग करता है। यह GPU को बढ़ते कॉन्टेक्स्ट वॉल्यूम को अवशोषित करने की अनुमति देता है, जबकि LPU पर लोड स्थिर रहता है और कॉन्टेक्स्ट लंबाई से स्वतंत्र होता है। हेटरोजीनियस डिकोडिंग के व्यावहारिक उपयोग के लिए, NVIDIA Dynamo अनुरोधों का ऑर्केस्ट्रेशन, कार्य वितरण और उच्च ट्रैफिक पर स्थिर विलंबता बनाए रखता है। संयोजन में, Vera Rubin NVL72 के साथ Groq 3 LPX, Grace Blackwell NVL72 की तुलना में 35 गुना अधिक थ्रूपुट प्रदान करता है, प्रति उपयोगकर्ता 400 TPS पर, और विलंबता-संवेदनशील वर्कलोड के लिए प्रति मेगावाट 10 गुना अधिक राजस्व देता है।
स्रोत: ServerNews — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार