Создание собственной GPT-подобной LLM по Warhammer 40K с нуля. Часть 4: Supervised Fine-Tuning на вопрос-ответ
Hugging Face
В четвёртой части цикла статей автор дообучает (Supervised Fine-Tuning, SFT) свою decoder-only LLM на датасете «вопрос-ответ», чтобы модель могла вести диалог, а не просто продолжать текст. Рассказывается о сборе данных, расширении токенизатора, подготовке датасета с маскировкой loss только на ответах ассистента, и о результатах обучения: модель усвоила формат ответа, но страдает неточностями по лору.
Автор цикла, Владимир, посвящает четвёртую часть дообучению своей decoder-only LLM (LinguaLaboratoriumMechanicus) на датасете «вопрос-ответ» (SFT). Цель — научить модель вести диалог, а не просто предсказывать следующий токен. Данные собраны с тематических форумов, статей и частично сгенерированы синтетически. В токенизатор добавлены специальные токены <|user|> и <|assistant|>, а словарь расширен
Показать ещё ↓
- Сокращения
- SFT = Supervised Fine-Tuning — контролируемая донастройка
- LLM = Large Language Model — большая языковая модель
- QA = Question Answering — вопрос-ответ
- JSON = JavaScript Object Notation — нотация объектов JavaScript
- EOS = End of Sequence — конец последовательности
- PAD = Padding — заполнение
- LR = Learning Rate — скорость обучения
- GPU = Graphics Processing Unit — графический процессор
- CLIP = Contrastive Language-Image Pre-training — контрастивное предобучение язык-изображение
Источник: Habr — хаб ИИ —
оригинал
