AllenAI Open Instruct Tulu 3 后训练:SFT、DPO、RLVR、GRPO 及基于验证器的评测
AllenAI
本教程演示了使用 AllenAI 的 Open Instruct 框架对语言模型进行端到端后训练的流程,并适配到 16 GB 显卡上运行。内容包括监督微调(SFT)、直接偏好优化(DPO)以及使用 GRPO 进行基于可验证奖励的强化学习(RLVR),并通过确定性验证器来评估数学答案。
本教程将指导您使用艾伦人工智能研究所的 Open Instruct 框架构建一个紧凑的指令调整语言模型。整个流程包括三个训练阶段:监督微调(SFT)、直接偏好优化(DPO)以及使用 GRPO 的带可验证奖励的强化学习(RLVR),全部适配以适应 16 GB 运行内存。实现利用了 Open Instruct 仓库,并有选择地加载如 DPO 损失、GRPO 损失和对数概率计算等功能。配置了 LoRA 适配器,并为每个阶段准备了 GSM8K 数据。使用确定性验证器(GSM8K、Math、IFEval)对生成的数学答案进行评分。分布式组件(如 vLLM、Ray 参与者和 DeepSpeed)被替换为适用于 Colab 的轻量级 Hugging Face 和 PyTorch 实现。所使用的模型是 Qwen2.5-0.5B-Instruct。
来源: MarkTechPost —
原文
