⚡ عاجل

NVIDIA Groq 3: SRAM والفصل والحتمية في منصة الذكاء الاصطناعي الجديدة

NVIDIANVIDIA GroqGroq
استحواذ NVIDIA بقيمة 20 مليار دولار على Groq أسفر عن دمج مسرعات LPU في منصة Vera Rubin، مما يتيح استنتاجًا غير متجانس ومفصولًا للذكاء الاصطناعي. يجمع نظام Groq 3 LPX الجديد بين 256 وحدة LPU لتوليد رمز سريع وحتمي، بينما تتعامل Vera Rubin NVL72 مع التدريب والاستنتاج المرنين. تستهدف المنصة تطبيقات الذكاء الاصطناعي التفاعلية منخفضة الكمون وأعباء العمل متعددة العوامل، واعدة بأداء أسرع يصل إلى 35 مرة من Grace Blackwell NVL72 بمعدل 400 رمز في الثانية لكل مستخدم.
دمجت NVIDIA بنية LPU (وحدة معالجة اللغة) من Groq في منصة الذكاء الاصطناعي Vera Rubin بعد الاستحواذ الذي بلغت قيمته 20 مليار دولار. والنتيجة هي نظام غير متجانس حيث تتعامل Vera Rubin NVL72 مع التدريب العام والاستدلال، بينما يوفر مسرع الرفوف Groq 3 LPX محركًا متخصصًا لتوليد الرموز منخفض الكمون. يحتوي LPX على 256 شريحة Groq 3 (LP30) تضم 96 مليار ترانزستور لكل منها، متصلة عبر واجهة RealScale C2C. صُممت LPU حول نموذج تنفيذ حتمي مع 500 ميغابايت من SRAM لكل شريحة (عرض نطاق 150 تيرابايت/ثانية)، دون ذاكرات تخزين مؤقت، وعمليات نقل بيانات صريحة يتحكم فيها المترجم. يزيل هذا التصميم التذبذب ويضمن كمونًا يمكن التنبؤ به، وهو أمر حاسم للذكاء الاصطناعي التفاعلي والأنظمة متعددة الوكلاء. تستخدم المنصة الفصل المرحلي (AFD) الذي يفصل عمليات الانتباه وشبكات التغذية الأمامية (FFN): تتعامل وحدة معالجة الرسومات (GPU) مع التعبئة المسبقة والانتباه طويل السياق، بينما تسرع LPU فك تشفير FFN/MoE. تدعي NVIDIA تسريعًا يصل إلى 35 ضعفًا مقارنة بـ Grace Blackwell NVL72 بمعدل 400 رمز في الثانية لكل مستخدم، وإيرادات تصل إلى 10 أضعاف لكل ميغاواط لأحمال العمل الحساسة للكمون. يقوم برنامج NVIDIA Dynamo بتنسيق عملية فك التشفير غير المتجانسة، وتصنيف الطلبات وإدارة التنشيطات الوسيطة.
المصدر: ServerNews — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة