QwQ-32B: Aprovechando el poder del aprendizaje por refuerzo
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen presentó el modelo QwQ-32B con 32 mil millones de parámetros, que logra un rendimiento comparable al de DeepSeek-R1 (671 mil millones de parámetros) mediante aprendizaje por refuerzo escalable. El modelo se publica como código abierto bajo la licencia Apache 2.0 y combina razonamiento con capacidades de agente.
Alibaba's Qwen ha presentado el modelo QwQ-32B con 32 mil millones de parámetros, aprovechando el aprendizaje por refuerzo (RL, por sus siglas en inglés) escalable. El modelo logra un rendimiento comparable al de DeepSeek-R1, que cuenta con 671 mil millones de parámetros (de los cuales 37 mil millones están activos). El desarrollo se basa en un arranque en frío y un RL en dos etapas: primero, en tareas matemáticas y de programación utilizando un verificador de corrección y un servidor de ejecución de código para validar soluciones; luego, en capacidades generales empleando un modelo de recompensa general y reglas. QwQ-32B integra capacidades de agente, lo que permite al modelo pensar críticamente, usar herramientas y adaptarse a la retroalimentación del entorno. El modelo está disponible como pesos abiertos en Hugging Face y ModelScope bajo la licencia Apache 2.0, así como a través de Qwen Chat y la API DashScope. En el futuro, Qwen planea combinar modelos base más potentes con cómputo de RL escalable para acercarse a la inteligencia artificial general (AGI, por sus siglas en inglés) e integrar agentes con RL para el razonamiento a largo plazo.
Fuente: Alibaba Qwen —
original
