Alibaba Qwen выпускает ProcessBench и улучшенные модели процессного вознаграждения для математического мышления
Alibaba/Qwen
OpenAI
Команда Qwen из Alibaba опубликовала в открытом доступе ProcessBench — бенчмарк для обнаружения ошибок в шагах математических рассуждений, а также выпустила две новые модели процессного вознаграждения (Process Reward Model, PRM) на основе Qwen2.5-Math. Эти модели превосходят существующие открытые PRM и демонстрируют высокую способность к выявлению ошибок.
Команда Qwen из Alibaba представила ProcessBench — бенчмарк, содержащий 3400 тестовых кейсов, сфокусированных на задачах олимпиадного и конкурсного уровня по математике, где эксперты вручную размечают первый ошибочный шаг в пошаговых решениях. Также были выпущены две новые модели Process Reward Models (PRM), а именно Qwen2.5-Math-PRM-7B и Qwen2.5-Math-PRM-72B, дообученные на основе моделей
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
