Пишем decoder-only трансформер для LLM с нуля на Python
Google/DeepMind
OpenAI
Meta
Автор цикла статей подробно описывает реализацию блока трансформера для небольшой decoder-only LLM на фреймворке PyTorch. Рассматриваются компоненты: Multi-Head Attention с маскированием, Feed Forward Network с GELU, слой нормализации и остаточные связи. В статье объясняется отличие от оригинальной архитектуры: используется преднормализация (Pre-LN) вместо постнормализации для стабильности обучения.
Автор Владимир на примере задачи по ватермаркированию лицензионного текста реализует блок трансформера для decoder-only LLM. Он объясняет, что трансформер — это архитектура из статьи Google "Attention Is All You Need", где последовательность обрабатывается параллельно с помощью механизма внимания. В основе Multi-Head Attention лежат три матрицы проекций Q, K, V. На первом этапе вычисляется
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- BPE = Byte Pair Encoding — байт-парное кодирование
- SFT = Supervised Fine-Tuning — контролируемая донастройка
- RNN = Recurrent Neural Network — рекуррентная нейронная сеть
- LSTM = Long Short-Term Memory — долгая краткосрочная память
- MHA = Multi-Head Attention — многоголовое внимание
Источник: Habr — хаб NLP —
оригинал
