Từ CUDA đến MLX: K-Search mang hàng thập kỷ chuyên môn kernel lên Apple Silicon
Apple
NVIDIA
Google/DeepMind
Các nhà nghiên cứu từ UC Berkeley Sky Lab đã mở rộng khung tối ưu hóa kernel tiến hóa K-Search với một backend MLX cho Apple Silicon. Họ phát triển một lớp dịch CUDA sang MLX có cấu trúc, chuyển giao hàng thập kỷ chuyên môn tối ưu hóa CUDA sang GPU Apple, đạt hiệu suất gần như chuyên gia trên các kernel attention và Mamba SSM.
Các nhà nghiên cứu từ Phòng thí nghiệm UC Berkeley Sky đã phát triển dựa trên K-Search, một khung tìm kiếm nhân tiến hóa sử dụng AI để tối ưu hóa nhân GPU, và mở rộng nó với một backend cho khung MLX của Apple. Họ đã phát triển một lớp dịch thuật có cấu trúc từ CUDA sang MLX, chuyển đổi các nhân CUDA hiện có thành các nhân chất lượng cao cho Apple Silicon. Phương pháp này đạt được tốc độ tăng gấp 0,97 lần so với nhân Attention MLX gốc và tăng tốc độ tiền xử lý (prefill) lên đến 20 lần so với triển khai mlx-lm cộng đồng trên nhân Mamba SSM. K-Search sử dụng một vòng lặp tối ưu hóa lặp đi lặp lại, trong đó một mô hình ngôn ngữ lớn (LLM) suy luận về các tối ưu hóa, tạo ra các nhân ứng viên, biên dịch và đánh giá hiệu năng trên phần cứng thực tế. Lớp dịch thuật bao gồm các bảng ánh xạ khái niệm, các gợi ý dành riêng cho MLX và các khẳng định có thể tái sử dụng để bảo tồn hành vi của các nhân chuyên gia. Công trình này chứng minh rằng việc tìm kiếm nhân do AI điều khiển có thể chuyển giao kiến thức tối ưu hóa giữa các hệ sinh thái phần cứng mà không cần phải bắt đầu lại từ đầu.
Nguồn: BAIR (Berkeley AI) —
bản gốc
