Profilage dans PyTorch (Partie 3) : L'attention est tout ce qu'il faut profiler
Cet article profile les mécanismes d'attention dans PyTorch, en comparant l'attention naïve, l'optimisation sur place et les backends de l'attention produit scalaire mise à l'échelle (SDPA). Il révèle que le backend mathématique de SDPA est plus lent que l'attention naïve en raison de la sous-utilisation des Tensor Cores, de la reconstruction du masque et du surcoût du softmax sécurisé.
PyTorch
NVIDIA

