연구오픈 소스 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 사후 학습: SFT, DPO, RLVR, GRPO 및 검증 기반 평가

AllenAIAllenAI
이 튜토리얼은 AllenAI의 Open Instruct 프레임워크를 사용하여 언어 모델의 종단 간 사후 학습 파이프라인을 시연하며, 16GB GPU에서 실행되도록 조정되었습니다. 지도 미세 조정(SFT), 직접 선호 최적화(DPO), 그리고 GRPO를 사용한 검증 가능한 보상 기반 강화 학습(RLVR)을 다루며, 수학적 답변을 평가하기 위한 결정적 검증기를 사용합니다.
이 튜토리얼은 AllenAI의 Open Instruct 프레임워크를 사용하여 컴팩트한 명령어 튜닝 언어 모델을 구축하는 과정을 안내합니다. 파이프라인에는 지도 학습 미세 조정(SFT), 직접 선호도 최적화(DPO), GRPO를 사용한 검증 가능한 보상 강화 학습(RLVR)의 세 가지 훈련 단계가 포함되며, 모두 16GB 런타임에 맞게 조정되었습니다. 구현은 Open Instruct 저장소를 활용하여 DPO 손실, GRPO 손실, 로그 확률 계산과 같은 함수를 선택적으로 로드합니다. LoRA 어댑터가 구성되고 각 단계에 맞게 GSM8K 데이터가 준비됩니다. 결정적 검증기(GSM8K, Math, IFEval)를 사용하여 생성된 수학 답변을 채점합니다. vLLM, Ray 액터, DeepSpeed와 같은 분산 구성 요소는 Colab에 적합한 경량 Hugging Face 및 PyTorch 구현으로 대체됩니다. 사용된 모델은 Qwen2.5-0.5B-Instruct입니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스