⚡ BREAKING
NVIDIA Groq 3: नए AI प्लेटफॉर्म में SRAM, डिसएग्रीगेशन और डिटर्मिनिज़्म
NVIDIA
Groq
NVIDIA द्वारा Groq के 20 बिलियन डॉलर के अधिग्रहण के परिणामस्वरूप LPU एक्सेलेरेटर को Vera Rubin प्लेटफॉर्म में एकीकृत किया गया है, जो डिसएग्रीगेटेड, हेटेरोजीनियस AI इन्फ्रेंस को सक्षम बनाता है। नया Groq 3 LPX रैक सिस्टम तेज़, डिटर्मिनिस्टिक टोकन जनरेशन के लिए 256 LPUs को जोड़ता है, जबकि Vera Rubin NVL72 लचीली ट्रेनिंग और इन्फ्रेंस को संभालता है। यह प्लेटफॉर्म कम-लेटेंसी इंटरएक्टिव AI और मल्टी-एजेंट वर्कलोड को लक्षित करता है, जो प्रति उपयोगकर्ता 400 TPS पर Grace Blackwell NVL72 से 35x तक तेज़ प्रदर्शन का वादा करता है।
NVIDIA ने $20 बिलियन के अधिग्रहण के बाद Groq की LPU (लैंग्वेज प्रोसेसिंग यूनिट - भाषा प्रसंस्करण इकाई) आर्किटेक्चर को अपने Vera Rubin AI प्लेटफॉर्म में एकीकृत कर लिया है। इसका परिणाम एक विषम प्रणाली है जहाँ Vera Rubin NVL72 सामान्य प्रशिक्षण और अनुमान को संभालता है, जबकि Groq 3 LPX रैक त्वरक कम-विलंबता टोकन जनरेशन के लिए एक विशेष इंजन प्रदान करता है। LPX में 256 Groq 3 (LP30) चिप हैं, जिनमें प्रत्येक में 96 बिलियन ट्रांजिस्टर होते हैं, जो RealScale C2C इंटरकनेक्ट के माध्यम से जुड़े होते हैं। LPU एक नियतात्मक निष्पादन मॉडल के आसपास डिज़ाइन किया गया है जिसमें प्रति चिप 500 MB SRAM (150 TB/s बैंडविड्थ) है, कोई कैश नहीं है, और एक कंपाइलर द्वारा नियंत्रित स्पष्ट डेटा मूवमेंट है। यह जिटर को समाप्त करता है और पूर्वानुमानित विलंबता सुनिश्चित करता है, जो इंटरैक्टिव AI और मल्टी-एजेंट सिस्टम के लिए महत्वपूर्ण है। प्लेटफॉर्म चरण विघटन (AFD) का उपयोग करता है जो अटेंशन और FFN संचालन को अलग करता है: GPU प्रीफिल और लंबे-संदर्भ अटेंशन को संभालता है, जबकि LPU FFN/MoE डिकोडिंग को तेज करता है। NVIDIA प्रति उपयोगकर्ता 400 TPS पर Grace Blackwell NVL72 पर 35x तक की स्पीडअप और विलंबता-संवेदनशील कार्यभार के लिए प्रति MW 10x तक राजस्व का दावा करता है। NVIDIA Dynamo सॉफ्टवेयर विषम डिकोडिंग का समन्वय करता है, अनुरोधों को वर्गीकृत करता है और मध्यवर्ती सक्रियताओं का प्रबंधन करता है।
स्रोत: ServerNews —
मूल
