알리바바 큐언, 수학적 추론을 위한 ProcessBench 및 개선된 프로세스 보상 모델 공개
Alibaba/Qwen
OpenAI
알리바바의 큐언 팀이 수학적 추론 단계에서 오류를 탐지하기 위한 벤치마크인 ProcessBench를 오픈소스로 공개하고, Qwen2.5-Math 기반의 두 가지 새로운 프로세스 보상 모델(PRM)을 출시했습니다. 이 모델들은 기존 오픈소스 PRM보다 뛰어난 성능을 보이며 강력한 오류 식별 능력을 입증했습니다.
알리바바의 Qwen 팀이 수학 경시 대회 및 올림피아드 수준의 문제를 대상으로 한 3,400개의 테스트 케이스로 구성된 벤치마크인 ProcessBench를 공개했습니다. 이 벤치마크에서는 인간 전문가가 단계별 풀이에서 가장 먼저 오류가 발생한 단계를 주석으로 표시합니다. 또한 Qwen2.5-Math-Instruct 모델을 미세 조정한 두 개의 새로운 프로세스 보상 모델(PRM, Process Reward Model), Qwen2.5-Math-PRM-7B와 Qwen2.5-Math-PRM-72B도 함께 공개했습니다. 일곱 개의 수학 벤치마크에서 Best-of-N 평가(N=8)를 수행한 결과, Qwen2.5-Math-PRM-7B가 다수결 투표 방식보다 평균 1.4% 더 높은 성능을 보였으며, 유사한 규모의 다른 프로세스 보상 모델과 동등하거나 더 나은 성능을 기록했습니다. ProcessBench에서 Qwen2.5-Math-PRM-7B는 GPT-4o-0806과 모든 오픈소스 모델을 능가했으며, o1-mini에만 뒤쳐졌습니다. 팀은 또한 결과 보상 모델(ORM, Outcome Reward Model)인 Qwen2.5-Math-RM-72B가 일부 프로세스 보상 모델을 능가하는 놀라운 단계 오류 탐지 능력을 보였다고 언급했습니다. 이 연구는 대규모 언어 모델(LLM)의 추론 과정에서 프로세스 감독을 개선하는 것을 목표로 합니다.
출처: Alibaba Qwen —
원문
