Forschung RSS

Forschung 🇺🇸

Profiling in PyTorch (Teil 3): Attention ist alles, was Sie profilen

Dieser Beitrag profiliert Aufmerksamkeitsmechanismen in PyTorch und vergleicht naive Aufmerksamkeit, In-Place-Optimierung und Backends der Skalierten Punktprodukt-Aufmerksamkeit (SDPA). Es zeigt, dass das Mathematik-Backend von SDPA aufgrund von Unterauslastung der Tensor Cores, Maskenrekonstruktion und Overhead durch sicheres Softmax langsamer ist als naive Aufmerksamkeit.

PyTorchPyTorch NVIDIANVIDIA
Hugging Face blog29.07 · 23:03
Aktuelle Nachrichten