OnderzoekHardware & Inferentie 🇺🇸 30.07.2026 03:03

Van CUDA naar MLX: Hoe K-Search decennia aan kernel-expertise naar Apple Silicon brengt

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Onderzoekers van UC Berkeley Sky Lab hebben het evolutionaire kerneloptimalisatieframework K-Search uitgebreid met een MLX-backend voor Apple Silicon. Ze ontwikkelden een gestructureerde vertaallaag van CUDA naar MLX die decennia aan CUDA-optimalisatie-expertise overdraagt naar Apple GPU's, met bijna-expertprestaties op attention- en Mamba-SSM-kernels.
Onderzoekers van het UC Berkeley Sky Lab hebben voortgebouwd op K-Search, een evolutionair kernelzoekraamwerk dat AI gebruikt om GPU-kernels te optimaliseren, en dit uitgebreid met een backend voor het MLX-framework van Apple. Ze ontwikkelden een nieuwe gestructureerde CUDA-naar-MLX-vertaalmodule die bestaande CUDA-kernels omzet in hoogwaardige kernels voor Apple Silicon. De aanpak behaalde een snelheidswinst van 0,97x ten opzichte van de native MLX Attention-kernel en tot 20x prefill-snelheidswinst ten opzichte van de community-implementatie van mlx-lm op de Mamba SSM-kernel. K-Search gebruikt een iteratieve optimalisatielus waarin een Large Language Model redeneert over optimalisaties, kandidaat-kernels genereert, compileert en benchmarkt op echte hardware. De vertaalmodule bevat conceptmappingtabellen, MLX-specifieke hints en herbruikbare beweringen die het gedrag van expertkernels behouden. Dit werk laat zien dat AI-gestuurd kernelonderzoek optimalisatiekennis kan overdragen tussen hardware-ecosystemen zonder opnieuw te beginnen.
Bron: BAIR (Berkeley AI) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws