एआई इंफ्रास्ट्रक्चर के छिपे नुकसान: लॉन्च के छह महीने बाद ग्राहक को क्या पता चलता है (और हमने इसे अपने हार्डवेयर-सॉफ्टवेयर कॉम्प्लेक्स में कैसे संबोधित किया)
NVIDIA
स्केला^र टीम (रूबीटेक समूह का हिस्सा) के एक आर्किटेक्ट ने उन विशिष्ट समस्याओं का वर्णन किया है जिनका सामना ग्राहकों को अपना एआई इंफ्रास्ट्रक्चर बनाते समय करना पड़ता है, जैसे एकीकरण के मुद्दे, जीपीयू चयन, नेटवर्क बाधाएं, बिजली और शीतलन, और प्रमाणन। लेख बताता है कि कैसे उनका तैयार हार्डवेयर-सॉफ्टवेयर कॉम्प्लेक्स (पीएके) स्केला^र एमआईआई परीक्षण किए गए स्टैक, अनुकूलित नेटवर्किंग और शेड्यूलर संवर्द्धन प्रदान करके इन मुद्दों से बचाता है।
यह लेख, जो स्काला^र (रूबीटेक समूह का हिस्सा) के आर्किटेक्ट एलेक्सी ने लिखा है, उन चुनौतियों पर चर्चा करता है जिनका सामना ग्राहकों को अपना AI इंफ्रास्ट्रक्चर बनाते समय करना पड़ता है। मुख्य नुकसानों में शामिल हैं: ऐसे घटक जो अकेले तो काम करते हैं लेकिन लोड के तहत एक साथ काम करने पर विफल हो जाते हैं; गलत GPU चुनना (अक्सर H100 जब इसकी आवश्यकता नहीं होती); नेटवर्क की गलत कॉन्फ़िगरेशन जो प्रदर्शन को बिगाड़ देती है (जैसे, RDMA ट्रैफ़िक को बैकअप ट्रैफ़िक के साथ मिलाना); Kubernetes क्लस्टर में फॉल्ट टॉलरेंस की कमी; बिजली और कूलिंग की आवश्यकताओं को कम आंकना; और विनियमित उद्योगों के लिए लंबी प्रमाणन प्रक्रिया। इन समस्याओं के समाधान के लिए, स्काला^र 'स्काला^र MII' हार्डवेयर-सॉफ्टवेयर कॉम्प्लेक्स प्रदान करता है, जो हार्डवेयर, ऑपरेटिंग सिस्टम, Kubernetes, GPU स्टैक और नेटवर्क स्टैक का पूर्व-परीक्षित संयोजन प्रदान करता है, जिससे तैनाती का समय 1-2 सप्ताह तक कम हो जाता है और स्व-संयोजन की तुलना में प्रदर्शन में 200-300% की वृद्धि होती है। यह कॉम्प्लेक्स कई GPU प्लेटफार्मों (NVIDIA और चीनी विकल्प) का समर्थन करता है और इसमें भौतिक ट्रैफ़िक पृथक्करण, MLAG नेटवर्किंग, GPU टोपोलॉजी जागरूकता के साथ कस्टम शेड्यूलर, रिडंडेंट पावर और FSTEC प्रमाणपत्र जैसी सुविधाएँ शामिल हैं। लेख तीन परिदृश्यों पर भी प्रकाश डालता है: ट्रेनिंग, फाइन-ट्यूनिंग और इंफ़रेंस, जहाँ PAK महत्वपूर्ण प्रदर्शन लाभ प्रदान करता है।
स्रोत: Habr — хаб ИИ —
मूल
