Do CUDA ao MLX: Como o K-Search Traz Décadas de Experiência em Kernels para o Apple Silicon
Apple
NVIDIA
Google/DeepMind
Pesquisadores do UC Berkeley Sky Lab estenderam o framework de otimização evolutiva de kernels K-Search com um backend MLX para Apple Silicon. Eles desenvolveram uma camada de tradução estruturada de CUDA para MLX que transfere décadas de experiência em otimização CUDA para GPUs da Apple, alcançando desempenho próximo ao de especialistas em kernels de atenção e Mamba SSM.
Pesquisadores do UC Berkeley Sky Lab desenvolveram o K-Search, um framework de busca evolucionária de kernels que utiliza IA para otimizar kernels de GPU, e o estenderam com um backend para o framework MLX da Apple. Eles criaram uma camada de tradução estruturada de CUDA para MLX que converte kernels CUDA existentes em kernels de alta qualidade para Apple Silicon. A abordagem atingiu uma aceleração de 0,97 vezes em comparação com o kernel nativo de Atenção do MLX e uma aceleração de até 20 vezes no preenchimento (prefill) em relação à implementação da comunidade mlx-lm no kernel Mamba SSM. O K-Search utiliza um loop de otimização iterativa onde um LLM raciocina sobre otimizações, gera kernels candidatos, compila e os avalia em hardware real. A camada de tradução inclui tabelas de mapeamento de conceitos, dicas específicas do MLX e asserções reutilizáveis que preservam comportamentos de kernels especialistas. O trabalho demonstra que a busca de kernels orientada por IA pode transferir conhecimento de otimização entre ecossistemas de hardware sem começar do zero.
Fonte: BAIR (Berkeley AI) —
original
