ModelosPesquisa 🇨🇳 28.07.2026 01:05

QwQ-32B: Aproveitando o Poder do Aprendizado por Reforço

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
A Alibaba Qwen apresentou o modelo QwQ-32B com 32 bilhões de parâmetros, que atinge desempenho comparável ao DeepSeek-R1 (671B parâmetros) por meio de aprendizado por reforço (reinforcement learning, RL) escalável. O modelo é de código aberto sob a licença Apache 2.0 e combina raciocínio com capacidades de agente.
A Alibaba Qwen lançou o modelo QwQ-32B com 32 bilhões de parâmetros, utilizando aprendizado por reforço (RL) escalável. O modelo alcança desempenho comparável ao DeepSeek-R1, que possui 671 bilhões de parâmetros (dos quais 37 bilhões estão ativos). O desenvolvimento é baseado em inicialização a frio e RL em dois estágios: primeiro, em tarefas matemáticas e de programação usando um verificador de correção e um servidor de execução de código para validar soluções; depois, em capacidades gerais usando um modelo de recompensa geral e regras. O QwQ-32B integra capacidades de agente, permitindo que o modelo pense criticamente, use ferramentas e se adapte ao feedback do ambiente. O modelo está disponível como pesos abertos no Hugging Face e no ModelScope sob a licença Apache 2.0, bem como via Qwen Chat e a API DashScope. No futuro, a Qwen planeja combinar modelos base mais fortes com computação RL escalável para se aproximar da inteligência artificial geral (AGI) e integrar agentes com RL para raciocínio de longo prazo.
Fonte: Alibaba Qwen — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas