Nghiên cứuMã nguồn mở 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 Hậu Huấn Luyện với SFT, DPO, RLVR, GRPO và Đánh Giá Dựa Trên Bộ Xác Minh

AllenAIAllenAI
Hướng dẫn này trình bày một quy trình hậu huấn luyện từ đầu đến cuối cho một mô hình ngôn ngữ sử dụng khung Open Instruct của AllenAI, được điều chỉnh để chạy trên GPU 16 GB. Nó bao gồm Tinh Chỉnh Có Giám Sát (SFT), Tối Ưu Hóa Ưu Tiên Trực Tiếp (DPO), và Học Tăng Cường với Phần Thưởng Có Thể Xác Minh (RLVR) sử dụng GRPO, với các bộ xác minh xác định để đánh giá câu trả lời toán học.
Hướng dẫn này sẽ hướng dẫn bạn xây dựng một mô hình ngôn ngữ tinh chỉnh theo chỉ dẫn nhỏ gọn bằng cách sử dụng khung Open Instruct của AllenAI. Quy trình bao gồm ba giai đoạn huấn luyện: Tinh chỉnh có giám sát (SFT), Tối ưu hóa trực tiếp sở thích (DPO) và Học tăng cường với phần thưởng có thể xác minh (RLVR) sử dụng GRPO, tất cả đều được điều chỉnh để phù hợp với môi trường chạy 16 GB. Việc triển khai tận dụng kho lưu trữ Open Instruct, chọn lọc các hàm như mất mát DPO, mất mát GRPO và tính toán xác suất log. Bộ điều hợp LoRA được cấu hình và dữ liệu GSM8K được chuẩn bị cho từng giai đoạn. Bộ xác minh xác định (GSM8K, Math, IFEval) được sử dụng để chấm điểm các câu trả lời toán học được tạo ra. Các thành phần phân tán như vLLM, Ray actors và DeepSpeed được thay thế bằng các triển khai Hugging Face và PyTorch nhẹ phù hợp với Colab. Mô hình được sử dụng là Qwen2.5-0.5B-Instruct.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới