AllenAI Open Instruct Tulu 3 : post-entraînement avec SFT, DPO, RLVR, GRPO et évaluation par vérificateur
AllenAI
Ce tutoriel présente un pipeline complet de post-entraînement pour un modèle de langage à l'aide du cadre Open Instruct d'AllenAI, adapté pour fonctionner sur un GPU de 16 Go. Il couvre le Supervised Fine-Tuning (SFT), l'Optimisation Directe des Préférences (DPO) et l'Apprentissage par Renforcement avec Récompenses Vérifiables (RLVR) utilisant GRPO, avec des vérificateurs déterministes pour évaluer les réponses mathématiques.
Ce tutoriel explique comment construire un modèle de langage compact ajusté par instructions à l'aide du framework Open Instruct d'AllenAI. Le pipeline comprend trois étapes d'entraînement : l'ajustement fin supervisé (SFT), l'optimisation directe des préférences (DPO) et l'apprentissage par renforcement avec récompenses vérifiables (RLVR) utilisant GRPO, le tout adapté pour tenir dans un environnement d'exécution de 16 Go. La mise en œuvre s'appuie sur le référentiel Open Instruct, en chargeant sélectivement des fonctions telles que la perte DPO, la perte GRPO et les calculs de probabilité logarithmique. Des adaptateurs LoRA sont configurés et les données GSM8K sont préparées pour chaque étape. Des vérificateurs déterministes (GSM8K, Math, IFEval) sont utilisés pour évaluer les réponses mathématiques générées. Les composants distribués tels que vLLM, les acteurs Ray et DeepSpeed sont remplacés par des implémentations légères de Hugging Face et PyTorch adaptées à Colab. Le modèle utilisé est Qwen2.5-0.5B-Instruct.
Source: MarkTechPost —
original
