Пишем декодерный трансформер для LLM с нуля на Python
Google/DeepMind
OpenAI
Meta
Автор серии статей подробно описывает реализацию блока трансформера для небольшой декодерной LLM с использованием фреймворка PyTorch. Рассмотрены компоненты: masked Multi-Head Attention (многоголовое внимание с маскированием), Feed Forward Network (сеть прямого распространения) с функцией активации GELU, слой нормализации и остаточные соединения. В статье объясняется отличие от оригинальной архитектуры: для стабильности обучения используется предварительная нормализация (Pre-LN) вместо пост-нормализации.
Автор Владимир на примере задачи нанесения водяных знаков на лицензированный текст реализует блок трансформера для декодерной LLM. Он объясняет, что трансформер — это архитектура из статьи Google «Attention Is All You Need», где последовательность обрабатывается параллельно с помощью механизма внимания. Multi-Head Attention основана на трёх проекционных матрицах: Q, K, V. На первом шаге
Показать ещё ↓
Источник: Habr — хаб NLP —
оригинал
