研究ハードウェア・推論 🇺🇸 30.07.2026 03:03

CUDAからMLXへ:K-SearchがもたらすApple Silicon向けカーネル専門技術

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
UC Berkeley Sky Labの研究者らは、進化的カーネル最適化フレームワークK-SearchにApple Silicon向けMLXバックエンドを追加しました。構造化されたCUDA-to-MLX変換層を開発し、何十年にもわたるCUDA最適化の知見をApple GPUに移植することで、アテンションやMamba SSMカーネルで専門家に近い性能を達成しました。
カリフォルニア大学バークレー校スカイラボの研究者らは、GPUカーネルを最適化する進化的カーネル探索フレームワーク「K-Search」を基盤とし、AppleのMLXフレームワーク向けのバックエンドを拡張して開発した。彼らは、既存のCUDAカーネルをAppleシリコン用の高品質カーネルに変換する、新しい構造化CUDA-to-MLX変換レイヤーを考案した。このアプローチは、ネイティブMLX Attentionカーネルと比較して0.97倍の高速化を達成し、コミュニティのmlx-lm実装と比較してMamba SSMカーネルでは最大20倍のプリフィル高速化を実現した。K-Searchは反復的最適化ループを用いており、large language model (LLM)が最適化について推論し、候補カーネルを生成し、実際のハードウェア上でコンパイル・ベンチマークを行う。変換レイヤーには、概念マッピングテーブル、MLX固有のヒント、そしてエキスパートカーネルの振る舞いを保持する再利用可能なアサーションが含まれている。この研究は、AI駆動のカーネル探索が、ゼロから始めることなくハードウェアエコシステム間で最適化知識を転送できることを示している。
出典: BAIR (Berkeley AI) — 原文
関連記事 ↓
新着ニュース