Van CUDA naar MLX: Hoe K-Search decennia aan kernelexpertise naar Apple Silicon brengt
Apple
NVIDIA
Google/DeepMind
Onderzoekers van UC Berkeley Sky Lab hebben het K-Search evolutionaire kerneloptimalisatieraamwerk uitgebreid met een MLX-backend voor Apple Silicon. Ze ontwikkelden een gestructureerde CUDA-naar-MLX-vertaallaag die decennia aan CUDA-optimalisatie-expertise overdraagt naar Apple GPU's, waarmee bijna-expertprestaties op attention- en Mamba-SSM-kernels worden behaald.
Onderzoekers van het UC Berkeley Sky Lab hebben voortgebouwd op K-Search, een evolutionair kernelzoekraamwerk dat AI gebruikt om GPU-kernels te optimaliseren, en dit uitgebreid met een backend voor het MLX-framework van Apple. Ze ontwikkelden een nieuwe gestructureerde CUDA-naar-MLX-vertaalmodule die bestaande CUDA-kernels omzet in hoogwaardige kernels voor Apple Silicon. De aanpak behaalde een snelheidswinst van 0,97x ten opzichte van de native MLX Attention-kernel en tot 20x prefill-snelheidswinst ten opzichte van de community-implementatie van mlx-lm op de Mamba SSM-kernel. K-Search gebruikt een iteratieve optimalisatielus waarin een Large Language Model redeneert over optimalisaties, kandidaat-kernels genereert, compileert en benchmarkt op echte hardware. De vertaalmodule bevat conceptmappingtabellen, MLX-specifieke hints en herbruikbare beweringen die het gedrag van expertkernels behouden. Dit werk laat zien dat AI-gestuurd kernelonderzoek optimalisatiekennis kan overdragen tussen hardware-ecosystemen zonder opnieuw te beginnen.
Bron: BAIR (Berkeley AI) —
origineel
