AMD and Cerebras Join Forces to Develop Ultra-Low-Latency AI Inference Platform
Cerebras Systems
NVIDIA
AMD and Cerebras Systems are creating a computing platform that combines AMD Instinct accelerators and Cerebras WSE chips based on SRAM memory for low-latency inference of AI agents. The solution, available in Cerebras Cloud this year, generates five times more tokens per watt and requires fewer chips than similar systems from competitors.
AMD और Cerebras Systems ने एक कंप्यूटिंग प्लेटफ़ॉर्म के सह-विकास की घोषणा की है, जो AMD Instinct एक्सेलेरेटर्स और Cerebras Wafer Scale Engine (WSE) चिप्स को ऑन-चिप SRAM मेमोरी के साथ जोड़ता है। यह प्लेटफ़ॉर्म AI एजेंट इनफ़रेंस के लिए डिज़ाइन किया गया है, जो एक ऐसा चरण है जिसमें बड़ी मात्रा में तेज़ मेमोरी की आवश्यकता होती है। Cerebras के CEO एंड्रयू फेल्डमैन के अनुसार, यह प्रोजेक्ट AMD के पोर्टफ़ोलियो में एक कमी को पूरा करता है, जो Nvidia द्वारा स्टार्टअप Groq को $20 बिलियन में खरीदने के बाद उत्पन्न हुई थी। Cerebras WSE चिप्स HBM4 के बजाय SRAM का उपयोग करते हैं, जो प्रति सेकंड 2000 से अधिक टोकन की जनरेशन स्पीड प्रदान करता है। हाइब्रिड सिस्टम में, जटिल क्वेरीज़ AMD Instinct एक्सेलेरेटर्स पर प्रोसेस की जाती हैं, जबकि टोकन जनरेशन Cerebras WSE को सौंपी जाती है, जिससे ऊर्जा दक्षता (प्रति वाट टोकन) पाँच गुना बढ़ जाती है। तुलना के लिए: Kimi K2.5 मॉडल (1 ट्रिलियन पैरामीटर) को सर्विस करने के लिए दो हज़ार Groq चिप्स की आवश्यकता होती है, जबकि AMD और Cerebras सिस्टम में केवल कुछ दर्जन चिप्स लगते हैं। संयुक्त समाधान इस वर्ष के अंत तक Cerebras Cloud में उपलब्ध होगा।
स्रोत: 3DNews —
मूल
