ModelosPesquisa 🇨🇳 28.07.2026 16:03

Alibaba Qwen Lança ProcessBench e Modelos de Recompensa por Processo Aprimorados para Raciocínio Matemático

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
A equipe Qwen da Alibaba disponibilizou como código aberto o ProcessBench, um benchmark para detectar erros em etapas de raciocínio matemático, e lançou dois novos Modelos de Recompensa por Processo (PRMs) baseados no Qwen2.5-Math. Os modelos superam os PRMs de código aberto existentes e demonstram forte capacidade de identificação de erros.
A equipe Qwen da Alibaba apresentou o ProcessBench, um benchmark com 3.400 casos de teste focados em problemas de matemática em nível de competição e olimpíada, onde especialistas humanos anotam o primeiro passo errôneo em soluções passo a passo. Eles também lançaram dois novos Modelos de Recompensa de Processo (PRMs), o Qwen2.5-Math-PRM-7B e o Qwen2.5-Math-PRM-72B, ajustados a partir dos modelos Qwen2.5-Math-Instruct. Na avaliação Best-of-N (N=8) em sete benchmarks de matemática, o Qwen2.5-Math-PRM-7B superou a votação majoritária em média 1,4% e igualou ou superou outros PRMs de escala similar. No ProcessBench, o Qwen2.5-Math-PRM-7B superou o GPT-4o-0806 e todos os modelos de código aberto, ficando atrás apenas do o1-mini. A equipe também observou que o Modelo de Recompensa de Resultado Qwen2.5-Math-RM-72B mostrou uma capacidade surpreendente de detecção de erros de etapa, superando alguns PRMs. O trabalho visa melhorar a supervisão de processo no raciocínio de Grandes Modelos de Linguagem (LLMs).
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas