Alibaba Qwen выпускает ProcessBench и улучшенные модели процессного вознаграждения для математического мышления
Команда Qwen из Alibaba опубликовала в открытом доступе ProcessBench — бенчмарк для обнаружения ошибок в шагах математических рассуждений, а также выпустила две новые модели процессного вознаграждения (Process Reward Model, PRM) на основе Qwen2.5-Math. Эти модели превосходят существующие открытые PRM и демонстрируют высокую способность к выявлению ошибок.
Alibaba/Qwen
OpenAI
