Tehokkaiden GPU-ytimien suunnittelu TileLangilla: Tensor-GEMMit, sulautettu softmax, FlashAttention ja automaattiviritys
TileLang on korkean tason domain-spesifinen kieli Pythonissa, joka yksinkertaistaa GPU-ytimien luontia. Opas esittelee vaiheittaisen toteutuksen monimutkaisista tehtävistä: tensor-GEMMit, sulautettu softmax ja FlashAttention, jossa kääntäjä hoitaa matalan tason CUDA-yksityiskohdat.
TileLang, Pythonille rakennettu korkean tason alakohtainen kieli, on esitelty yksinkertaistamaan huipputehokkaiden GPU-ydinten suunnittelua. Opetusohjelma esittelee vaiheittaisen toteutuksen monimutkaisille työkuormille, mukaan lukien lohkokohtaiset GEMM-tensorilaskennat tensorisydämillä, sulautettu softmax ja FlashAttention. Kääntäjä hoitaa automaattisesti monimutkaisen säikeiden kartoituksen, muistiasettelun ja matalan tason CUDA-käskyjen tuottamisen, jolloin kehittäjät voivat keskittyä algoritmiseen logiikkaan manuaalisen optimoinnin sijaan.
Lähde: MarkTechPost —
Alkuperäinen
