Perfilado en PyTorch (Parte 3): La atención es todo lo que perfilas
Este artículo perfila los mecanismos de atención en PyTorch, comparando la atención ingenua, la optimización in-place y los backends de Atención de Producto Punto Escalado (SDPA). Revela que el backend matemático de SDPA es más lento que la atención ingenua debido a la infrautilización de Tensor Core, la reconstrucción de máscaras y la sobrecarga de softmax seguro.
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03

