AllenAI Open Instruct Tulu 3 Pós-Treinamento com SFT, DPO, RLVR, GRPO e Avaliação Baseada em Verificador
AllenAI
Este tutorial demonstra um pipeline de pós-treinamento de ponta a ponta para um modelo de linguagem usando o framework Open Instruct da AllenAI, adaptado para rodar em uma GPU de 16 GB. Ele cobre o Ajuste Fino Supervisionado (SFT), a Otimização Direta de Preferência (DPO) e o Aprendizado por Reforço com Recompensas Verificáveis (RLVR) usando GRPO, com verificadores determinísticos para avaliar respostas matemáticas.
O tutorial percorre a construção de um modelo de linguagem compacto ajustado por instruções usando o framework Open Instruct da AllenAI. O pipeline inclui três etapas de treinamento: Ajuste Fino Supervisionado (SFT), Otimização Direta de Preferência (DPO) e Aprendizado por Reforço com Recompensas Verificáveis (RLVR) usando GRPO, todas adaptadas para caber em um runtime de 16 GB. A implementação aproveita o repositório Open Instruct, carregando seletivamente funções como a perda DPO, a perda GRPO e cálculos de log-probabilidade. Adaptadores LoRA são configurados e os dados GSM8K são preparados para cada etapa. Verificadores determinísticos (GSM8K, Matemática, IFEval) são usados para pontuar respostas matemáticas geradas. Componentes distribuídos como vLLM, atores Ray e DeepSpeed são substituídos por implementações leves de Hugging Face e PyTorch adequadas para o Colab. O modelo usado é o Qwen2.5-0.5B-Instruct.
Fonte: MarkTechPost —
original
