Проектирование высокопроизводительных GPU-ядер с TileLang: тензорные GEMM, fused softmax, FlashAttention и автонастройка
TileLang — высокоуровневый предметно-ориентированный язык на Python для упрощения создания GPU-ядер. В руководстве показана пошаговая реализация сложных задач: тензорные GEMM, fused softmax и FlashAttention, где компилятор берёт на себя низкоуровневые детали CUDA.
TileLang, высокоуровневый предметно-ориентированный язык, построенный на Python, был представлен для упрощения разработки высокопроизводительных GPU-ядер. В руководстве демонстрируется пошаговая реализация сложных рабочих нагрузок, включая блочные тензорные вычисления GEMM на тензорных ядрах, объединенный софтмакс и FlashAttention. Компилятор автоматически обрабатывает сложное отображение
Показать ещё ↓
Источник: MarkTechPost —
оригинал
