Создание собственной GPT-подобной LLM по Warhammer 40K с нуля. Часть 4: Supervised Fine-Tuning на вопрос-ответ
В четвёртой части цикла статей автор дообучает (Supervised Fine-Tuning, SFT) свою decoder-only LLM на датасете «вопрос-ответ», чтобы модель могла вести диалог, а не просто продолжать текст. Рассказывается о сборе данных, расширении токенизатора, подготовке датасета с маскировкой loss только на ответах ассистента, и о результатах обучения: модель усвоила формат ответа, но страдает неточностями по лору.
Hugging Face
Habr — хаб ИИ24.07 · 10:02

