NVIDIA Transformer Engine, फ्यूज़्ड कर्नेल, BF16, FP8 और GPU बेंचमार्किंग के साथ ट्रांसफॉर्मर प्रशिक्षण को तेज़ करना

NVIDIANVIDIA
यह ट्यूटोरियल बताता है कि कैसे NVIDIA Transformer Engine फ्यूज़्ड GPU कर्नेल, BF16 गणना और हार्डवेयर-जागरूक FP8 निष्पादन को मिलाकर ट्रांसफॉर्मर वर्कलोड को तेज़ करता है। इसमें इंस्टॉलेशन, GPU पहचान, मॉड्यूल टूर, FP8 रेसिपी कॉन्फ़िगरेशन, मॉडल प्रशिक्षण, बेंचमार्किंग और ऑटोरग्रेसिव जनरेशन शामिल है।
यह ट्यूटोरियल NVIDIA Transformer Engine को स्थापित करने और PyTorch वातावरण को आरंभ करने से शुरू होता है। यह GPU आर्किटेक्चर का पता लगाता है ताकि यह निर्धारित किया जा सके कि TE कर्नेल और FP8 टेंसर कोर समर्थित हैं या नहीं, और असमर्थित हार्डवेयर के लिए शुद्ध- PyTorch फ़ॉलबैक प्रदान करता है। te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP और te.TransformerLayer जैसे मुख्य संलयित घटकों की जांच की जाती है। एक विलंबित-स्केलिंग FP8 रेसिपी को संकर E4M3/E5M2 प्रारूपों और amax इतिहास के साथ कॉन्फ़िगर किया गया है। संलयित te.TransformerLayer ब्लॉकों का उपयोग करके एक कॉम्पैक्ट GPT-शैली कारणात्मक भाषा मॉडल बनाया गया है, और तुलना के लिए एक समतुल्य शुद्ध- PyTorch मॉडल लागू किया गया है। मॉडल को नियतात्मक सिंथेटिक अंकगणित-पैटर्न अनुक्रमों पर प्रशिक्षित किया जाता है, जिसमें समर्थित होने पर सशर्त FP8 ऑटोकास्ट शामिल होता है। बेंचमार्किंग BF16 और FP8 मोड के लिए औसत चरण विलंबता और शिखर GPU मेमोरी को मापती है। FP8 मेटाडेटा, जिसमें स्केलिंग कारक और amax इतिहास शामिल हैं, का निरीक्षण किया जाता है। अंत में, लालची ऑटोरेग्रेसिव जनरेशन यह सत्यापित करता है कि मॉडल अंकगणितीय स्ट्राइड सीखता है, और बड़े मॉडल और वैकल्पिक FP8 प्रारूपों जैसे विस्तारों का सुझाव दिया गया है।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार