从CUDA到MLX:K-Search将数十年的内核优化经验引入Apple Silicon
Apple
NVIDIA
Google/DeepMind
加州大学伯克利分校Sky Lab的研究人员为K-Search进化式内核优化框架扩展了MLX后端,支持Apple Silicon。他们开发了结构化的CUDA到MLX转换层,将数十年的CUDA优化专业知识迁移到Apple GPU上,在注意力机制和Mamba状态空间模型内核上实现了接近专家水平的性能。
加州大学伯克利分校Sky Lab的研究人员基于K-Search(一种利用AI优化GPU内核的进化内核搜索框架)进行了扩展,为其增加了针对苹果MLX框架的后端支持。他们开发了一种新颖的结构化CUDA到MLX的转换层,可将现有CUDA内核转换为适用于Apple Silicon的高质量内核。该方法相比原生MLX注意力内核实现了0.97倍的加速,并且在Mamba状态空间模型(SSM)内核上,相比社区mlx-lm实现实现了高达20倍的预填充加速。K-Search采用迭代优化循环,其中大型语言模型(LLM)推理优化策略、生成候选内核,并在真实硬件上进行编译和基准测试。转换层包括概念映射表、MLX专用提示以及可复用的断言,以保留专家内核的行为。这项工作表明,AI驱动的内核搜索可以在不同硬件生态间传递优化知识,而无需从头开始。
来源: BAIR (Berkeley AI) —
原文
