Profiling no PyTorch (Parte 3): Atenção é tudo que você precisa perfilhar
Este post faz a perfilhagem de mecanismos de atenção no PyTorch, comparando atenção ingênua, otimização in-place e backends de Atenção de Produto Escalar (SDPA, na sigla em inglês). Revela que o backend matemático do SDPA é mais lento que a atenção ingênua devido à subutilização do Tensor Core, reconstrução de máscara e sobrecarga do softmax seguro.
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03

