CUDA'dan MLX'e: K-Search, Apple Silicon'a Onlarca Yıllık Kernel Uzmanlığını Nasıl Getiriyor?
Apple
NVIDIA
Google/DeepMind
UC Berkeley Sky Laboratuvarı'ndaki araştırmacılar, K-Search evrimsel kernel optimizasyon çerçevesini Apple Silicon için bir MLX arka ucuyla genişletti. Onlarca yıllık CUDA optimizasyon uzmanlığını Apple GPU'larına aktaran yapılandırılmış bir CUDA'dan MLX'e çeviri katmanı geliştirdiler ve dikkat ile Mamba SSM çekirdeklerinde uzman seviyesine yakın performans elde ettiler.
UC Berkeley Sky Lab araştırmacıları, GPU çekirdeklerini optimize etmek için yapay zeka kullanan evrimsel bir çekirdek arama çerçevesi olan K-Search üzerine inşa ederek, Apple'ın MLX çerçevesi için bir arka uç eklediler. Mevcut CUDA çekirdeklerini Apple Silicon için yüksek kaliteli çekirdeklere dönüştüren yeni bir yapılandırılmış CUDA'dan MLX'e çeviri katmanı geliştirdiler. Bu yaklaşım, yerel MLX Attention çekirdeğine kıyasla 0,97x hızlanma ve topluluk mlx-lm uygulamasına kıyasla Mamba SSM çekirdeğinde 20 kata kadar ön doldurma hızlanması sağladı. K-Search, bir LLM'nin optimizasyonlar hakkında akıl yürüttüğü, aday çekirdekler oluşturduğu, bunları gerçek donanımda derleyip kıyasladığı yinelemeli bir optimizasyon döngüsü kullanır. Çeviri katmanı, kavram eşleme tabloları, MLX'e özgü ipuçları ve uzman çekirdek davranışlarını koruyan yeniden kullanılabilir iddialar içerir. Çalışma, yapay zeka odaklı çekirdek aramanın, sıfırdan başlamadan donanım ekosistemleri arasında optimizasyon bilgisi aktarabileceğini göstermektedir.
Kaynak: BAIR (Berkeley AI) —
orijinal
