Profiling in PyTorch (Teil 3): Attention ist alles, was Sie profilen
Dieser Beitrag profiliert Aufmerksamkeitsmechanismen in PyTorch und vergleicht naive Aufmerksamkeit, In-Place-Optimierung und Backends der Skalierten Punktprodukt-Aufmerksamkeit (SDPA). Es zeigt, dass das Mathematik-Backend von SDPA aufgrund von Unterauslastung der Tensor Cores, Maskenrekonstruktion und Overhead durch sicheres Softmax langsamer ist als naive Aufmerksamkeit.
PyTorch
NVIDIA

