Alibaba Qwen phát hành ProcessBench và các mô hình phần thưởng quy trình cải tiến cho suy luận toán học
Alibaba/Qwen
OpenAI
Nhóm Qwen của Alibaba đã mã nguồn mở ProcessBench, một benchmark để phát hiện lỗi trong các bước suy luận toán học, và phát hành hai mô hình phần thưởng quy trình mới dựa trên Qwen2.5-Math. Các mô hình này vượt trội hơn các mô hình phần thưởng quy trình mã nguồn mở hiện tại và thể hiện khả năng xác định lỗi mạnh mẽ.
Nhóm Qwen của Alibaba đã giới thiệu ProcessBench, một bộ benchmark với 3.400 ca kiểm thử tập trung vào các bài toán cấp độ thi đấu và Olympic, trong đó các chuyên gia con người chú thích bước sai đầu tiên trong các lời giải từng bước. Họ cũng phát hành hai Mô hình Phần thưởng Quy trình mới, Qwen2.5-Math-PRM-7B và Qwen2.5-Math-PRM-72B, được tinh chỉnh từ các mô hình Qwen2.5-Math-Instruct. Trong đánh giá Best-of-N (N=8) trên bảy benchmark toán học, Qwen2.5-Math-PRM-7B vượt trội hơn phương pháp bỏ phiếu đa số trung bình 1,4%, và đạt ngang bằng hoặc vượt các PRM khác cùng quy mô. Trên ProcessBench, Qwen2.5-Math-PRM-7B vượt qua GPT-4o-0806 và tất cả các mô hình mã nguồn mở, chỉ thua kém o1-mini. Nhóm nghiên cứu cũng lưu ý rằng Mô hình Phần thưởng Kết quả Qwen2.5-Math-RM-72B cho thấy khả năng phát hiện lỗi bước đáng ngạc nhiên, vượt qua một số PRM. Công trình này nhằm cải thiện giám sát quy trình trong suy luận của các mô hình ngôn ngữ lớn.
Nguồn: Alibaba Qwen —
bản gốc
