OnderzoekOpen Source 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 Post-Training met SFT, DPO, RLVR, GRPO en Verificator-gebaseerde Evaluatie

AllenAIAllenAI
Deze tutorial demonstreert een end-to-end post-training pijplijn voor een taalmodel met behulp van het Open Instruct-framework van AllenAI, aangepast om te draaien op een 16 GB GPU. Het behandelt Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) en Reinforcement Learning met Verifieerbare Beloningen (RLVR) met behulp van GRPO, met deterministische verificatoren voor het evalueren van wiskundige antwoorden.
De tutorial leidt je door het bouwen van een compact instructie-afgestemd taalmodel met behulp van AllenAI's Open Instruct-framework. De pijplijn omvat drie trainingsfasen: Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO) en Reinforcement Learning with Verifiable Rewards (RLVR) met behulp van GRPO, allemaal aangepast om te passen in een runtime van 16 GB. De implementatie maakt gebruik van de Open Instruct-repository en selectief geladen functies zoals DPO-verlies, GRPO-verlies en log-kansberekeningen. LoRA-adapters zijn geconfigureerd en GSM8K-gegevens worden voor elke fase voorbereid. Deterministische verificateurs (GSM8K, Math, IFEval) worden gebruikt om gegenereerde wiskundige antwoorden te scoren. Gedistribueerde componenten zoals vLLM, Ray-actors en DeepSpeed worden vervangen door lichtgewicht Hugging Face- en PyTorch-implementaties die geschikt zijn voor Colab. Het gebruikte model is Qwen2.5-0.5B-Instruct.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws