сходство токенов (матрица внимания), на втором — смешивается содержимое токенов по найденным весам. Для эффективности все головы внимания реализованы через одну большую линейную проекцию. После attention применяется Feed Forward Network с GELU-активацией и dropout. Сборка трансформера включает нормализацию (Pre-LN) и остаточные связи. Также добавляется маска будущего (causal mask) для decoder. В целом блок готов к использованию в сборке LLM, обучении и генерации текста.