InvestigaciónHardware e Inferencia 🇺🇸 30.07.2026 03:03

De CUDA a MLX: Cómo K-Search lleva décadas de experiencia en kernels al Apple Silicon

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Investigadores del Sky Lab de la UC Berkeley extendieron el marco de optimización evolutiva de kernels K-Search con un backend de MLX para Apple Silicon. Desarrollaron una capa de traducción estructurada de CUDA a MLX que transfiere décadas de experiencia en optimización de CUDA a las GPU de Apple, logrando un rendimiento cercano al de expertos en kernels de atención y Mamba SSM.
Investigadores del Berkeley Sky Lab han mejorado K-Search, un marco evolutivo de búsqueda de kernels que utiliza inteligencia artificial para optimizar kernels de GPU, y lo han extendido con un backend para el framework MLX de Apple. Desarrollaron una novedosa capa de traducción estructurada de CUDA a MLX que convierte kernels CUDA existentes en kernels de alta calidad para Apple Silicon. El enfoque logró una aceleración de 0,97 veces en comparación con el kernel de atención nativo de MLX y hasta 20 veces de aceleración en el prellenado frente a la implementación comunitaria mlx-lm en el kernel Mamba SSM. K-Search utiliza un bucle de optimización iterativo donde un LLM razona sobre optimizaciones, genera kernels candidatos, los compila y los evalúa en hardware real. La capa de traducción incluye tablas de mapeo de conceptos, sugerencias específicas de MLX y aserciones reutilizables que preservan comportamientos expertos de los kernels. Este trabajo demuestra que la búsqueda de kernels impulsada por IA puede transferir conocimiento de optimización entre ecosistemas de hardware sin empezar desde cero.
Fuente: BAIR (Berkeley AI) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas