ModelosInvestigación 🇨🇳 28.07.2026 16:03

Alibaba Qwen lanza ProcessBench y modelos mejorados de recompensa de proceso para razonamiento matemático

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
El equipo Qwen de Alibaba ha publicado como código abierto ProcessBench, un punto de referencia para detectar errores en los pasos de razonamiento matemático, y ha lanzado dos nuevos modelos de recompensa de proceso (PRM, por sus siglas en inglés) basados en Qwen2.5-Math. Los modelos superan a los PRM de código abierto existentes y muestran una sólida capacidad de identificación de errores.
El equipo de Qwen de Alibaba presentó ProcessBench, un benchmark con 3400 casos de prueba centrados en problemas de nivel de competencia y Olimpiada de matemáticas, donde expertos humanos anotan el paso erróneo más temprano en soluciones paso a paso. También lanzaron dos nuevos Modelos de Recompensa de Proceso (PRM, por sus siglas en inglés), Qwen2.5-Math-PRM-7B y Qwen2.5-Math-PRM-72B, ajustados a partir de los modelos Qwen2.5-Math-Instruct. En la evaluación Best-of-N (N=8) en siete benchmarks de matemáticas, Qwen2.5-Math-PRM-7B superó al voto mayoritario en un promedio de 1,4%, e igualó o superó a otros PRM de escala similar. En ProcessBench, Qwen2.5-Math-PRM-7B superó a GPT-4o-0806 y a todos los modelos de código abierto, quedando solo por detrás de o1-mini. El equipo también señaló que el Modelo de Recompensa de Resultado Qwen2.5-Math-RM-72B mostró una sorprendente capacidad de detección de errores en los pasos, superando a algunos PRM. El trabajo tiene como objetivo mejorar la supervisión de procesos en el razonamiento de los modelos de lenguaje de gran escala (LLM, por sus siglas en inglés).
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas