RechercheMatériel et Inférence 🇺🇸 30.07.2026 03:03

De CUDA à MLX : comment K-Search apporte des décennies d'expertise en kernels à Apple Silicon

AppleApple NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
Des chercheurs du UC Berkeley Sky Lab ont étendu le framework d'optimisation évolutionnaire de kernels K-Search avec un backend MLX pour Apple Silicon. Ils ont développé une couche de traduction structurée CUDA vers MLX qui transfère des décennies d'expertise en optimisation CUDA aux GPU Apple, atteignant des performances quasi-expertes sur les kernels d'attention et de Mamba SSM.
Des chercheurs du UC Berkeley Sky Lab se sont appuyés sur K-Search, un cadre évolutif de recherche de noyaux qui utilise l'IA pour optimiser les noyaux GPU, et l'ont étendu avec un backend pour le framework MLX d'Apple. Ils ont développé une nouvelle couche de traduction structurée de CUDA vers MLX qui convertit les noyaux CUDA existants en noyaux de haute qualité pour Apple Silicon. Cette approche a atteint un facteur d'accélération de 0,97x par rapport au noyau Attention natif de MLX et jusqu'à 20x d'accélération du préremplissage par rapport à l'implémentation communautaire mlx-lm sur le noyau Mamba SSM. K-Search utilise une boucle d'optimisation itérative où un LLM raisonne sur les optimisations, génère des noyaux candidats, les compile et les évalue sur du matériel réel. La couche de traduction comprend des tables de correspondance de concepts, des indices spécifiques à MLX et des assertions réutilisables qui préservent les comportements experts des noyaux. Ces travaux démontrent que la recherche de noyaux pilotée par l'IA peut transférer des connaissances d'optimisation entre écosystèmes matériels sans repartir de zéro.
Source: BAIR (Berkeley AI) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches