CUDA से MLX तक: K-Search कैसे Apple Silicon के लिए दशकों की कर्नेल विशेषज्ञता लाता है

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने K-Search इवोल्यूशनरी कर्नेल ऑप्टिमाइज़ेशन फ्रेमवर्क को Apple Silicon के लिए MLX बैकएंड के साथ विस्तारित किया। उन्होंने एक संरचित CUDA-से-MLX अनुवाद परत विकसित की जो CUDA ऑप्टिमाइज़ेशन की दशकों की विशेषज्ञता को Apple GPU में स्थानांतरित करती है, जिससे अटेंशन और Mamba SSM कर्नेल पर निकट-विशेषज्ञ प्रदर्शन प्राप्त होता है।
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने K-Search पर काम किया, जो GPU कर्नेल को अनुकूलित करने के लिए AI का उपयोग करने वाला एक इवोल्यूशनरी कर्नेल सर्च फ्रेमवर्क है, और इसे Apple के MLX फ्रेमवर्क के लिए एक बैकएंड के साथ विस्तारित किया। उन्होंने एक नवीन संरचित CUDA-to-MLX अनुवाद परत विकसित की जो मौजूदा CUDA कर्नेल को Apple Silicon के लिए उच्च गुणवत्ता वाले कर्नेल में परिवर्तित करती है। इस दृष्टिकोण ने देशी MLX अटेंशन कर्नेल की तुलना में 0.97x स्पीडअप प्राप्त किया और Mamba SSM कर्नेल पर समुदाय के mlx-lm कार्यान्वयन पर 20x तक प्रीफिल स्पीडअप प्राप्त किया। K-Search एक पुनरावृत्त अनुकूलन लूप का उपयोग करता है जहां एक एलएलएम अनुकूलन के बारे में तर्क करता है, उम्मीदवार कर्नेल उत्पन्न करता है, उन्हें संकलित करता है और वास्तविक हार्डवेयर पर बेंचमार्क करता है। अनुवाद परत में अवधारणा मैपिंग टेबल, MLX-विशिष्ट संकेत, और पुन: प्रयोज्य अभिकथन शामिल हैं जो विशेषज्ञ कर्नेल व्यवहार को संरक्षित करते हैं। यह कार्य दर्शाता है कि AI-चालित कर्नेल सर्च शुरू से शुरू किए बिना हार्डवेयर इकोसिस्टम में अनुकूलन ज्ञान स्थानांतरित कर सकता है।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार