CUDAsta MLX:hin: K-Search tuo vuosikymmenten kernel-asiantuntemuksen Apple Siliconille
Apple
NVIDIA
Google/DeepMind
UC Berkeleyn Sky Labin tutkijat laajensivat K-Search-evoluutioydinoptimointikehystä MLX-taustajärjestelmällä Apple Siliconille. He kehittivät rakenteellisen CUDA–MLX-käännöskerroksen, joka siirtää vuosikymmenten CUDA-optimointiosaamisen Applen GPU:ille saavuttaen lähes asiantuntijatason suorituskyvyn huomio- ja Mamba SSM -ytimissä.
UC Berkeleyn Sky Labin tutkijat rakensivat K-Searchin, evolutiivisen kernelienhakukehyksen, joka käyttää tekoälyä GPU-kernelien optimointiin, ja laajensivat sitä taustajärjestelmällä Applen MLX-kehykselle. He kehittivät uudenlaisen rakenteellisen CUDA–MLX-käännöskerroksen, joka muuntaa olemassa olevat CUDA-ytimet korkealaatuisiksi ytimiksi Apple Siliconille. Menetelmä saavutti 0,97-kertaisen nopeutuksen verrattuna alkuperäiseen MLX Attention -ytimeen ja jopa 20-kertaisen esitäyttönopeutuksen verrattuna yhteisön mlx-lm-toteutukseen Mamba SSM -ytimessä. K-Search käyttää iteratiivista optimointisilmukkaa, jossa kielimalli perustelee optimointeja, tuottaa ehdokasyttimiä, kääntää ja vertailee niitä oikealla laitteistolla. Käännöskerros sisältää käsitekartoitustaulukoita, MLX-kohtaisia vihjeitä ja uudelleenkäytettäviä väittämiä, jotka säilyttävät asiantuntijaytimien käyttäytymisen. Työ osoittaa, että tekoälyohjattu kernelienhaku voi siirtää optimointitietoa laitteistoekosysteemien välillä aloittamatta alusta.
Lähde: BAIR (Berkeley AI) —
Alkuperäinen
