ИсследованияOpen Source 🇷🇺 27.07.2026 20:04

Пишем decoder-only трансформер для LLM с нуля на Python

Google/DeepMindGoogle/DeepMind OpenAIOpenAI MetaMeta
Автор цикла статей подробно описывает реализацию блока трансформера для небольшой decoder-only LLM на фреймворке PyTorch. Рассматриваются компоненты: Multi-Head Attention с маскированием, Feed Forward Network с GELU, слой нормализации и остаточные связи. В статье объясняется отличие от оригинальной архитектуры: используется преднормализация (Pre-LN) вместо постнормализации для стабильности обучения.
Автор Владимир на примере задачи по ватермаркированию лицензионного текста реализует блок трансформера для decoder-only LLM. Он объясняет, что трансформер — это архитектура из статьи Google "Attention Is All You Need", где последовательность обрабатывается параллельно с помощью механизма внимания. В основе Multi-Head Attention лежат три матрицы проекций Q, K, V. На первом этапе вычисляется
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
BPE = Byte Pair Encoding — байт-парное кодирование
SFT = Supervised Fine-Tuning — контролируемая донастройка
RNN = Recurrent Neural Network — рекуррентная нейронная сеть
LSTM = Long Short-Term Memory — долгая краткосрочная память
MHA = Multi-Head Attention — многоголовое внимание
Источник: Habr — хаб NLP — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости