От CUDA до MLX: как K-Search переносит десятилетия экспертизы в области ядер на Apple Silicon
Исследователи из Sky Lab Калифорнийского университета в Беркли расширили фреймворк эволюционной оптимизации ядер K-Search, добавив бэкенд MLX для Apple Silicon. Они разработали структурированный слой трансляции CUDA в MLX, который переносит десятилетия опыта оптимизации ядер CUDA на графические процессоры Apple, достигая производительности, близкой к экспертному уровню, на ядрах внимания и Mamba SSM.
Исследователи из лаборатории UC Berkeley Sky Lab развили фреймворк K-Search, использующий искусственный интеллект для оптимизации GPU-ядер, и расширили его бэкендом для фреймворка MLX от Apple. Они разработали новый структурированный слой трансляции CUDA-to-MLX, который преобразует существующие CUDA-ядра в высококачественные ядра для Apple Silicon. Подход достиг ускорения в 0,97 раза по сравнению
Показать ещё ↓
Источник: BAIR (Berkeley AI) —
оригинал
