МоделиOpen Source 🇷🇺 24.07.2026 10:02

Создание собственной GPT-подобной LLM по Warhammer 40K с нуля. Часть 4: Supervised Fine-Tuning на вопрос-ответ

Hugging FaceHugging Face
В четвёртой части цикла статей автор дообучает (Supervised Fine-Tuning, SFT) свою decoder-only LLM на датасете «вопрос-ответ», чтобы модель могла вести диалог, а не просто продолжать текст. Рассказывается о сборе данных, расширении токенизатора, подготовке датасета с маскировкой loss только на ответах ассистента, и о результатах обучения: модель усвоила формат ответа, но страдает неточностями по лору.
Автор цикла, Владимир, посвящает четвёртую часть дообучению своей decoder-only LLM (LinguaLaboratoriumMechanicus) на датасете «вопрос-ответ» (SFT). Цель — научить модель вести диалог, а не просто предсказывать следующий токен. Данные собраны с тематических форумов, статей и частично сгенерированы синтетически. В токенизатор добавлены специальные токены <|user|> и <|assistant|>, а словарь расширен
Показать ещё ↓
Сокращения
SFT = Supervised Fine-Tuning — контролируемая донастройка
LLM = Large Language Model — большая языковая модель
QA = Question Answering — вопрос-ответ
JSON = JavaScript Object Notation — нотация объектов JavaScript
EOS = End of Sequence — конец последовательности
PAD = Padding — заполнение
LR = Learning Rate — скорость обучения
GPU = Graphics Processing Unit — графический процессор
CLIP = Contrastive Language-Image Pre-training — контрастивное предобучение язык-изображение
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости