математических и программистских задачах с использованием верификатора корректности и сервера выполнения кода для проверки решений, затем на общих способностях с применением общей модели вознаграждения и правил. QwQ-32B интегрирует агентные возможности, позволяя модели критически мыслить, использовать инструменты и адаптироваться к обратной связи от окружения. Модель доступна с открытыми весами на Hugging Face и ModelScope под лицензией Apache 2.0, а также через Qwen Chat и DashScope API. В будущем Qwen планирует объединить более сильные базовые модели с масштабируемыми вычислениями RL для приближения к искусственному общему интеллекту (artificial general intelligence, AGI) и интегрировать агенты с RL для долгосрочного рассуждения.