CUDA से MLX तक: K-Search कैसे Apple Silicon पर कर्नेल विशेषज्ञता लाता है

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने Apple Silicon के लिए MLX बैकएंड के साथ K-Search इवोल्यूशनरी कर्नेल ऑप्टिमाइज़ेशन फ्रेमवर्क का विस्तार किया। उन्होंने एक संरचित CUDA-से-MLX अनुवाद परत विकसित की जो दशकों की CUDA ऑप्टिमाइज़ेशन विशेषज्ञता को Apple GPUs में स्थानांतरित करती है, जिससे अटेंशन और Mamba SSM कर्नेल पर लगभग विशेषज्ञ-स्तरीय प्रदर्शन प्राप्त होता है।
यूसी बर्कले स्काई लैब के शोधकर्ताओं ने K-Search पर काम किया, जो GPU कर्नेल को अनुकूलित करने के लिए AI का उपयोग करने वाला एक इवोल्यूशनरी कर्नेल सर्च फ्रेमवर्क है, और इसे Apple के MLX फ्रेमवर्क के लिए एक बैकएंड के साथ विस्तारित किया। उन्होंने एक नवीन संरचित CUDA-to-MLX अनुवाद परत विकसित की जो मौजूदा CUDA कर्नेल को Apple Silicon के लिए उच्च गुणवत्ता वाले कर्नेल में परिवर्तित करती है। इस दृष्टिकोण ने देशी MLX अटेंशन कर्नेल की तुलना में 0.97x स्पीडअप प्राप्त किया और Mamba SSM कर्नेल पर समुदाय के mlx-lm कार्यान्वयन पर 20x तक प्रीफिल स्पीडअप प्राप्त किया। K-Search एक पुनरावृत्त अनुकूलन लूप का उपयोग करता है जहां एक एलएलएम अनुकूलन के बारे में तर्क करता है, उम्मीदवार कर्नेल उत्पन्न करता है, उन्हें संकलित करता है और वास्तविक हार्डवेयर पर बेंचमार्क करता है। अनुवाद परत में अवधारणा मैपिंग टेबल, MLX-विशिष्ट संकेत, और पुन: प्रयोज्य अभिकथन शामिल हैं जो विशेषज्ञ कर्नेल व्यवहार को संरक्षित करते हैं। यह कार्य दर्शाता है कि AI-चालित कर्नेल सर्च शुरू से शुरू किए बिना हार्डवेयर इकोसिस्टम में अनुकूलन ज्ञान स्थानांतरित कर सकता है।
स्रोत: BAIR (Berkeley AI) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार