从CUDA到MLX:K-Search如何将数十年内核专业知识引入Apple Silicon
Apple
NVIDIA
Google/DeepMind
加州大学伯克利分校Sky Lab的研究人员将K-Search进化内核优化框架扩展了MLX后端以支持Apple Silicon。他们开发了一个结构化的CUDA到MLX翻译层,将数十年的CUDA优化专业知识转移到Apple GPU上,在注意力机制和Mamba SSM内核上实现了接近专家水平的性能。
加州大学伯克利分校Sky Lab的研究人员基于K-Search(一种利用AI优化GPU内核的进化内核搜索框架)进行了扩展,为其增加了针对苹果MLX框架的后端支持。他们开发了一种新颖的结构化CUDA到MLX的转换层,可将现有CUDA内核转换为适用于Apple Silicon的高质量内核。该方法相比原生MLX注意力内核实现了0.97倍的加速,并且在Mamba状态空间模型(SSM)内核上,相比社区mlx-lm实现实现了高达20倍的预填充加速。K-Search采用迭代优化循环,其中大型语言模型(LLM)推理优化策略、生成候选内核,并在真实硬件上进行编译和基准测试。转换层包括概念映射表、MLX专用提示以及可复用的断言,以保留专家内核的行为。这项工作表明,AI驱动的内核搜索可以在不同硬件生态间传递优化知识,而无需从头开始。
来源: BAIR (Berkeley AI) —
原文
