AllenAI Open Instruct Tulu 3 Post-Training mit SFT, DPO, RLVR, GRPO und Verifier-basierter Bewertung
AllenAI
Dieses Tutorial demonstriert eine End-to-End-Post-Training-Pipeline für ein Sprachmodell unter Verwendung des AllenAI Open Instruct Frameworks, angepasst für eine 16-GB-GPU. Es umfasst Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) und Reinforcement Learning mit überprüfbaren Belohnungen (RLVR) unter Verwendung von GRPO, mit deterministischen Verifiern zur Bewertung mathematischer Antworten.
Das Tutorial führt durch den Aufbau eines kompakten, instruktionsabgestimmten Sprachmodells unter Verwendung des Open Instruct Frameworks von AllenAI. Die Pipeline umfasst drei Trainingsphasen: Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) und Reinforcement Learning with Verifiable Rewards (RLVR) unter Verwendung von GRPO, die alle an eine Laufzeit von 16 GB angepasst sind. Die Implementierung nutzt das Open Instruct Repository und lädt selektiv Funktionen wie DPO-Loss, GRPO-Loss und Log-Wahrscheinlichkeitsberechnungen. LoRA-Adapter werden konfiguriert und GSM8K-Daten für jede Phase vorbereitet. Deterministische Verifizierer (GSM8K, Math, IFEval) werden verwendet, um generierte mathematische Antworten zu bewerten. Verteilte Komponenten wie vLLM, Ray-Aktoren und DeepSpeed werden durch leichte Hugging Face- und PyTorch-Implementierungen ersetzt, die für Colab geeignet sind. Das verwendete Modell ist Qwen2.5-0.5B-Instruct.
Quelle: MarkTechPost —
Original
