AllenAI Open Instruct Tulu 3 Pelatihan Lanjutan dengan SFT, DPO, RLVR, GRPO, dan Evaluasi Berbasis Verifier
AllenAI
Tutorial ini mendemonstrasikan alur pelatihan lanjutan end-to-end untuk model bahasa menggunakan kerangka kerja AllenAI Open Instruct, yang diadaptasi untuk berjalan pada GPU 16 GB. Ini mencakup Supervised Fine-Tuning (SFT), Direct Preference Optimization (DPO), dan Reinforcement Learning dengan Verifiable Rewards (RLVR) menggunakan GRPO, dengan verifier deterministik untuk mengevaluasi jawaban matematika.
Tutorial ini memandu pembangunan model bahasa yang diinstruksikan secara ringkas menggunakan kerangka Open Instruct dari AllenAI. Alur prosesnya mencakup tiga tahap pelatihan: Penyetelan Halus yang Diawasi (Supervised Fine-Tuning, SFT), Optimasi Preferensi Langsung (Direct Preference Optimization, DPO), dan Pembelajaran Penguatan dengan Imbalan yang Dapat Diverifikasi (Reinforcement Learning with Verifiable Rewards, RLVR) menggunakan GRPO, semuanya disesuaikan agar berjalan pada memori 16 GB. Implementasinya memanfaatkan repositori Open Instruct, secara selektif memuat fungsi-fungsi seperti kerugian DPO, kerugian GRPO, dan perhitungan probabilitas log. Adaptor LoRA dikonfigurasi, dan data GSM8K disiapkan untuk setiap tahap. Verifikator deterministik (GSM8K, Math, IFEval) digunakan untuk menilai jawaban matematika yang dihasilkan. Komponen terdistribusi seperti vLLM, aktor Ray, dan DeepSpeed diganti dengan implementasi Hugging Face dan PyTorch yang ringan dan cocok untuk Colab. Model yang digunakan adalah Qwen2.5-0.5B-Instruct.
Sumber: MarkTechPost —
asli
