研究硬件与推理 🇺🇸 30.07.2026 03:03

从CUDA到MLX:K-Search如何将数十年的内核专业知识引入Apple Silicon

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
来自加州大学伯克利分校Sky Lab的研究人员为Apple Silicon扩展了K-Search进化内核优化框架,增加了MLX后端。他们开发了一个结构化的CUDA到MLX转换层,将数十年的CUDA优化专业知识迁移到Apple GPU上,在注意力机制和Mamba SSM内核上实现了接近专家级性能。
加州大学伯克利分校Sky Lab的研究人员基于K-Search(一种利用AI优化GPU内核的进化内核搜索框架)进行了扩展,为其增加了针对苹果MLX框架的后端支持。他们开发了一种新颖的结构化CUDA到MLX的转换层,可将现有CUDA内核转换为适用于Apple Silicon的高质量内核。该方法相比原生MLX注意力内核实现了0.97倍的加速,并且在Mamba状态空间模型(SSM)内核上,相比社区mlx-lm实现实现了高达20倍的预填充加速。K-Search采用迭代优化循环,其中大型语言模型(LLM)推理优化策略、生成候选内核,并在真实硬件上进行编译和基准测试。转换层包括概念映射表、MLX专用提示以及可复用的断言,以保留专家内核的行为。这项工作表明,AI驱动的内核搜索可以在不同硬件生态间传递优化知识,而无需从头开始。
来源: BAIR (Berkeley AI) — 原文
我们之前关于此话题的帖子 ↓
最新新闻