PyTorch でのプロファイリング(第3回):アテンションこそプロファイリングの要
この記事では、PyTorch におけるアテンション機構のプロファイリングを行い、ナイーブなアテンション、インプレース最適化、Scaled Dot Product Attention(SDPA)バックエンドを比較します。SDPA の math バックエンドは、Tensor Core の未活用、マスクの再構築、セーフソフトマックスのオーバーヘッドにより、ナイーブなアテンションよりも遅いことが明らかになります。
PyTorch
NVIDIA
Hugging Face blog29.07 · 23:03

