PyTorch 프로파일링 (3부): 프로필링은 어텐션에 달려 있다
이 글에서는 PyTorch에서의 어텐션 메커니즘을 프로파일링합니다. 네이티브 어텐션, 인플레이스 최적화, 그리고 Scaled Dot Product Attention(SDPA) 백엔드를 비교합니다. SDPA의 수학 백엔드는 텐서 코어 활용 부족, 마스크 재구성, 안전한 소프트맥스 오버헤드로 인해 네이티브 어텐션보다 느린 것으로 나타났습니다.
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03

