المزالق الخفية في البنية التحتية للذكاء الاصطناعي: ما الذي يتعلمه العميل بعد ستة أشهر من الإطلاق (وكيف عالجناها في مجمعنا البرمجي-العتادي)
NVIDIA
يصف مهندس معماري من فريق Scala^r (جزء من مجموعة Rubytech) المشكلات النمطية التي يواجهها العملاء عند بناء بنيتهم التحتية الخاصة للذكاء الاصطناعي، مثل مشكلات التكامل، واختيار وحدات معالجة الرسوميات (GPU)، واختناقات الشبكة، والطاقة والتبريد، والشهادات. تشرح المقالة كيف يتجنب مجمعهم البرمجي-العتادي الجاهز (PAK) Scala^r MII هذه المشكلات من خلال توفير حزمة تقنية مختبرة، وشبكات محسّنة، وتحسينات في المجدول.
كتب أليكسي، المهندس المعماري في Scala^r (جزء من مجموعة Rubytech)، مقالًا يناقش التحديات التي يواجهها العملاء عند بناء بنيتهم التحتية الخاصة بالذكاء الاصطناعي. تشمل المزالق الرئيسية: مكونات تعمل بشكل فردي لكنها تفشل معًا تحت الحمل؛ اختيار وحدة معالجة الرسوميات الخاطئة (غالبًا H100 عندما لا تكون هناك حاجة إليها)؛ سوء تكوين الشبكة الذي يضعف الأداء (على سبيل المثال، خلط حركة مرور RDMA مع حركة مرور النسخ الاحتياطي)؛ عدم وجود تحمل للأعطال في مجموعات Kubernetes؛ التقليل من تقدير متطلبات الطاقة والتبريد؛ وعملية الاعتماد الطويلة للصناعات الخاضعة للتنظيم. ولمعالجة هذه المشكلات، تقدم Scala^r مجمع البرامج والأجهزة 'Scala^r MII'، الذي يوفر مزيجًا مُختبَرًا مسبقًا من الأجهزة ونظام التشغيل وKubernetes ومكدس وحدات معالجة الرسوميات ومكدس الشبكة، مما يقلل وقت النشر إلى 1-2 أسبوعًا ويزيد الأداء بنسبة 200-300٪ مقارنة بالتجميع الذاتي. يدعم المجمع منصات متعددة لوحدات معالجة الرسوميات (NVIDIA والبدائل الصينية) ويتضمن ميزات مثل فصل حركة المرور ماديًا، وشبكات MLAG، وجدولة مخصصة مع إدراك طوبولوجيا وحدة معالجة الرسوميات، وإمداد طاقة احتياطي، وشهادات FSTEC. يسلط المقال الضوء أيضًا على ثلاثة سيناريوهات: التدريب، والضبط الدقيق، والاستدلال، حيث يوفر المجمع مكاسب كبيرة في الأداء.
المصدر: Habr — хаб ИИ —
الأصلي
