памяти, экономя время и память. Затем вводится Scaled Dot Product Attention (SDPA). Его математический бэкенд, хотя и более безопасный (обрабатывает случаи NaN) и точный (FP32), оказывается в 3,7 раза медленнее наивного внимания, поскольку запускает 20 ядер GPU, не использует Tensor Cores (использует sgemm вместо bf16 Tensor Core matmul), заново строит каузальную маску при каждом вызове и применяет _safe_softmax. В публикации отмечается, что SDPA обычно автоматически выбирает самый быстрый бэкенд.