研究オープンソース 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct チュートリアル:Tulu 3 のポストトレーニング(SFT、DPO、RLVR、GRPO、検証器ベース評価)

AllenAIAllenAI
このチュートリアルでは、AllenAI の Open Instruct フレームワークを用いた言語モデルのエンドツーエンドのポストトレーニングパイプラインを、16 GB のGPUで動作するように調整して実演します。教師ありファインチューニング(SFT)、直接選好最適化(DPO)、検証可能な報酬を用いた強化学習(RLVR)をGRPOで行い、数学的解答の評価には決定論的検証器を使用します。
このチュートリアルでは、AllenAIのOpen Instructフレームワークを使用して、コンパクトな命令チューニング済み言語モデルを構築する手順を説明します。パイプラインには、教師ありファインチューニング(SFT)、直接選好最適化(DPO)、およびGRPOを使用した検証可能な報酬による強化学習(RLVR)の3つのトレーニング段階が含まれており、すべて16 GBのランタイムに適合するように調整されています。実装ではOpen Instructリポジトリを活用し、DPO損失、GRPO損失、対数確率計算などの関数を選択的にロードします。LoRAアダプタが構成され、各段階用にGSM8Kデータが準備されます。決定論的検証器(GSM8K、Math、IFEval)を使用して、生成された数学的解答をスコアリングします。vLLM、Rayアクター、DeepSpeedなどの分散コンポーネントは、Colabに適した軽量なHugging FaceおよびPyTorch実装に置き換えられます。使用されるモデルはQwen2.5-0.5B-Instructです。
出典: MarkTechPost — 原文
関連記事 ↓
新着ニュース