Alibaba Qwen выпускает ProcessBench и улучшенные модели процессного вознаграждения для математического рассуждения
Alibaba/Qwen
OpenAI
Команда Qwen из Alibaba открыла исходный код ProcessBench — бенчмарка для обнаружения ошибок в шагах математического рассуждения, и выпустила две новые модели процессного вознаграждения (Process Reward Models, PRMs) на основе Qwen2.5-Math. Модели превосходят существующие открытые PRM и демонстрируют сильные способности к выявлению ошибок.
Команда Qwen из Alibaba представила ProcessBench — бенчмарк, содержащий 3400 тестовых кейсов, сфокусированных на задачах олимпиадного и конкурсного уровня по математике, где эксперты вручную размечают первый ошибочный шаг в пошаговых решениях. Также были выпущены две новые модели Process Reward Models (PRM), а именно Qwen2.5-Math-PRM-7B и Qwen2.5-Math-PRM-72B, дообученные на основе моделей
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
