Профилирование в PyTorch (Часть 3): Внимание — это всё, что вы профилируете
В этом посте рассматривается профилирование механизмов внимания в PyTorch: сравниваются наивное внимание, оптимизация in-place и бэкенды Scaled Dot Product Attention (SDPA). Выясняется, что математический бэкенд SDPA медленнее наивного внимания из-за неполного использования тензорных ядер, перестроения маски и накладных расходов безопасного softmax.
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03
