Qwen2.5-Math-Instruct. В оценке методом Best-of-N (N=8) по семи математическим бенчмаркам Qwen2.5-Math-PRM-7B превзошла мажоритарное голосование в среднем на 1,4%, а также сравнялась или превзошла другие PRM аналогичного масштаба. На ProcessBench модель Qwen2.5-Math-PRM-7B обошла GPT-4o-0806 и все модели с открытым исходным кодом, уступив только o1-mini. Команда также отметила, что модель Outcome Reward Model (ORM) Qwen2.5-Math-RM-72B продемонстрировала удивительную способность обнаруживать ошибки на уровне шагов, превзойдя некоторые PRM. Работа направлена на улучшение процессного контроля (process supervision) в рассуждениях языковых моделей.