Lập Hồ Sơ Hiệu Năng trong PyTorch (Phần 3): Attention là tất cả những gì bạn cần lập hồ sơ
Bài viết này lập hồ sơ hiệu năng các cơ chế attention trong PyTorch, so sánh attention naive, tối ưu hóa tại chỗ và các backend của Scaled Dot Product Attention (SDPA). Kết quả cho thấy backend toán học của SDPA chậm hơn attention naive do tận dụng Tensor Core kém, tái tạo mask và chi phí safe softmax.
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03

