Создание собственной LLM типа GPT для Warhammer 40K с нуля. Часть 4: Контролируемая тонкая настройка на парах вопрос-ответ
Hugging Face
Четвертая часть серии по созданию декодерной LLM с нуля, посвященная контролируемой тонкой настройке (Supervised Fine-Tuning, SFT) на датасете вопрос-ответ для обеспечения диалога. Автор расширяет токенизатор специальными токенами ролей, создает набор данных вопрос-ответ и проводит тонкую настройку модели, отмечая, что, хотя потери уменьшаются, качество генерации может ухудшаться из-за переобучения. Контрольная точка выбирается на основе качества генерации, а не минимальных потерь.
Статья описывает этап SFT (supervised fine-tuning, контролируемая донастройка) обучения небольшой декодерной LLM для лора Warhammer 40K. После предварительного обучения базовая модель может продолжать текст, но не может отвечать на вопросы. Автор собирает пары вопрос-ответ из форумов, статей и синтетических данных, затем создает ChatQADataset, который маскирует потери только на токенах
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
