AllenAI Open Instruct Tulu 3: пост-обучение с SFT, DPO, RLVR, GRPO и проверкой на основе верификатора
Это руководство демонстрирует сквозной конвейер пост-обучения языковой модели с использованием фреймворка Open Instruct от AllenAI, адаптированный для работы на GPU с 16 ГБ памяти. Оно охватывает контролируемую точную настройку (SFT), оптимизацию прямых предпочтений (DPO) и обучение с подкреплением на основе проверяемых вознаграждений (RLVR) с использованием GRPO, а также детерминированные верификаторы для оценки математических ответов.
В этом руководстве пошагово разбирается создание компактной языковой модели, обученной следованию инструкциям, с помощью фреймворка Open Instruct от AllenAI. Конвейер включает три этапа обучения: контролируемое дообучение (Supervised Fine-Tuning, SFT), прямую оптимизацию предпочтений (Direct Preference Optimization, DPO) и обучение с подкреплением с проверяемыми вознаграждениями (Reinforcement
Показать ещё ↓
Источник: MarkTechPost —
оригинал
