CUDA से MLX तक: K-Search Apple Silicon के लिए दशकों की कर्नेल विशेषज्ञता कैसे लाता है

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने K-Search इवोल्यूशनरी कर्नेल ऑप्टिमाइज़ेशन फ्रेमवर्क को Apple Silicon के लिए MLX बैकएंड के साथ विस्तारित किया। उन्होंने एक संरचित CUDA-to-MLX अनुवाद परत विकसित की जो CUDA ऑप्टिमाइज़ेशन के दशकों के अनुभव को Apple GPUs में स्थानांतरित करती है, और अटेंशन और Mamba SSM कर्नेल पर लगभग विशेषज्ञ-स्तरीय प्रदर्शन प्राप्त करती है।
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने K-Search पर काम किया, जो GPU कर्नेल को अनुकूलित करने के लिए AI का उपयोग करने वाला एक इवोल्यूशनरी कर्नेल सर्च फ्रेमवर्क है, और इसे Apple के MLX फ्रेमवर्क के लिए एक बैकएंड के साथ विस्तारित किया। उन्होंने एक नवीन संरचित CUDA-to-MLX अनुवाद परत विकसित की जो मौजूदा CUDA कर्नेल को Apple Silicon के लिए उच्च गुणवत्ता वाले कर्नेल में परिवर्तित करती है। इस दृष्टिकोण ने देशी MLX अटेंशन कर्नेल की तुलना में 0.97x स्पीडअप प्राप्त किया और Mamba SSM कर्नेल पर समुदाय के mlx-lm कार्यान्वयन पर 20x तक प्रीफिल स्पीडअप प्राप्त किया। K-Search एक पुनरावृत्त अनुकूलन लूप का उपयोग करता है जहां एक एलएलएम अनुकूलन के बारे में तर्क करता है, उम्मीदवार कर्नेल उत्पन्न करता है, उन्हें संकलित करता है और वास्तविक हार्डवेयर पर बेंचमार्क करता है। अनुवाद परत में अवधारणा मैपिंग टेबल, MLX-विशिष्ट संकेत, और पुन: प्रयोज्य अभिकथन शामिल हैं जो विशेषज्ञ कर्नेल व्यवहार को संरक्षित करते हैं। यह कार्य दर्शाता है कि AI-चालित कर्नेल सर्च शुरू से शुरू किए बिना हार्डवेयर इकोसिस्टम में अनुकूलन ज्ञान स्थानांतरित कर सकता है।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार