AllenAI Open Instruct Tulu 3 Post-Entrenamiento con SFT, DPO, RLVR, GRPO y Evaluación Basada en Verificador
AllenAI
Este tutorial demuestra un pipeline de post-entrenamiento de extremo a extremo para un modelo de lenguaje utilizando el marco Open Instruct de AllenAI, adaptado para ejecutarse en una GPU de 16 GB. Cubre el Ajuste Fino Supervisado (SFT), la Optimización Directa de Preferencias (DPO) y el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) utilizando GRPO, con verificadores deterministas para evaluar respuestas matemáticas.
El tutorial explica cómo construir un modelo de lenguaje compacto ajustado por instrucciones utilizando el marco Open Instruct de AllenAI. El flujo de trabajo incluye tres etapas de entrenamiento: ajuste fino supervisado (SFT), optimización directa de preferencias (DPO) y aprendizaje por refuerzo con recompensas verificables (RLVR) mediante GRPO, todas adaptadas para caber en un entorno de ejecución de 16 GB. La implementación aprovecha el repositorio Open Instruct, cargando selectivamente funciones como la pérdida DPO, la pérdida GRPO y los cálculos de log-probabilidades. Se configuran adaptadores LoRA y se preparan datos GSM8K para cada etapa. Se utilizan verificadores deterministas (GSM8K, Math, IFEval) para calificar las respuestas matemáticas generadas. Los componentes distribuidos como vLLM, actores de Ray y DeepSpeed se reemplazan con implementaciones ligeras de Hugging Face y PyTorch adecuadas para Colab. El modelo utilizado es Qwen2.5-0.5B-Instruct.
Fuente: MarkTechPost —
original
