⚡ عاجل
NVIDIA Groq 3: ذاكرة SRAM والفصل والحتمية في منصة الذكاء الاصطناعي الجديدة
NVIDIA
Groq
بعد استحواذ NVIDIA على شركة Groq مقابل 20 مليار دولار، قامت بدمج مسرعات LPU في منصة Vera Rubin، مما أدى إلى إنشاء بنية غير متجانسة للاستدلال. يعمل مسرع الرف الجديد Groq 3 LPX، استنادًا إلى رقائق Groq 3 LP30 بسعة 500 ميجابايت من ذاكرة SRAM وعرض نطاق ترددي للذاكرة يبلغ 150 تيرابايت في الثانية، على ضمان التنفيذ الحتمي وزمن انتقال منخفض. يتيح الفصل القائم على المرحلة لفك الترميز (AFD) فصل حسابات FFN عن الانتباه، مما يوزع عبء العمل بين وحدات معالجة الرسومات ووحدات LPU.
أكملت NVIDIA أكبر صفقة في تاريخها من خلال الاستحواذ على Groq مقابل 20 مليار دولار، ودمج مسرعات الذكاء الاصطناعي الغريبة هندسيًا LPU في منصتها Vera Rubin لتسريع الاستدلال بشكل كبير، مما يجعله منفصلاً والمنصة غير متجانسة. يحتوي مسرع الرف الجديد NVIDIA Groq 3 LPX بقدرة 160 كيلوواط على 256 شريحة ذكاء اصطناعي Groq 3 (LP30) تحتوي كل منها على 96 مليار ترانزستور، مجمعة في 32 عقدة بارتفاع 1U مع تبريد سائل وتصميم خالٍ من الكابلات MGX. تم بناء شريحة Groq 3 LPU على ذاكرة SRAM بسعة 500 ميجابايت مع عرض نطاق ترددي يبلغ 150 تيرابايت/ثانية، بدون ذاكرات تخزين مؤقت أو تسلسل هرمي، مما يسمح بنقل البيانات بشكل صريح تحت سيطرة المترجم. السمة المميزة لـ LPU هي الحتمية - عدم وجود تباين في وقت التشغيل من خلال نقل جميع القرارات إلى المترجم واستخدام بروتوكول C2C متعدد الأطوار. الابتكار الرئيسي هو الفصل المرحلي لفك التشفير (AFD)، الذي يفصل آلية الانتباه التي يتم تنفيذها على وحدة معالجة الرسومات عن عمليات FFN/MoE التي تتم معالجتها على LPX. يسمح هذا لوحدة معالجة الرسومات بامتصاص أحجام السياق المتزايدة، بينما يظل الحمل على LPU ثابتًا ومستقلاً عن طول السياق. للاستخدام العملي لفك التشفير غير المتجانس، يوفر NVIDIA Dynamo تنسيق الطلبات وتوزيع العمل والحفاظ على زمن انتقال مستقر تحت حركة مرور كثيفة. في مجموعة Vera Rubin NVL72 مع Groq 3 LPX، توفر إنتاجية أعلى بمقدار 35 مرة مقارنة بـ Grace Blackwell NVL72 بمعدل 400 معاملة في الثانية لكل مستخدم، وما يصل إلى 10 أضعاف الإيرادات لكل ميجاواط للأحمال الحساسة لزمن الانتظار.
المصدر: ServerNews —
الأصلي
