ИсследованияOpen Source 🇺🇸 29.07.2026 23:03

Профилирование в PyTorch (Часть 3): Внимание — это всё, что вы профилируете

PyTorchPyTorch NVIDIANVIDIA
В этом посте рассматривается профилирование механизмов внимания в PyTorch: сравниваются наивное внимание, оптимизация in-place и бэкенды Scaled Dot Product Attention (SDPA). Выясняется, что математический бэкенд SDPA медленнее наивного внимания из-за неполного использования тензорных ядер, перестроения маски и накладных расходов безопасного softmax.
Третья публикация из серии «Профилирование в PyTorch» посвящена профилированию механизмов внимания. Вначале рассматривается наивный модуль внимания (matmul, масштабирование, маскирование, softmax, matmul), и его трассировка показывает 5 ядер GPU за один прямой проход. Замена функции masked_fill, работающей с созданием новой копии, на masked_fill_, работающую на месте, устраняет ядро копирования
Показать ещё ↓
Источник: Hugging Face blog — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости