QwQ-32B: масштабирование обучения с подкреплением
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen представила модель QwQ-32B с 32 миллиардами параметров, которая благодаря масштабированному обучению с подкреплением (RL) достигает производительности, сравнимой с DeepSeek-R1 (671 млрд параметров). Модель открыта под лицензией Apache 2.0 и доступна на Hugging Face, ModelScope и через Qwen Chat.
Команда Qwen из Alibaba анонсировала модель QwQ-32B с 32 миллиардами параметров, которая достигает производительности, сопоставимой с DeepSeek-R1 (671 млрд параметров, 37 млрд активированных). Это стало возможным благодаря масштабированию обучения с подкреплением (RL) на основе тщательно обученной базовой модели. В первом этапе RL применяли только для математики и программирования, используя верификатор точности и сервер выполнения кода для оценки результатов. Затем добавили второй этап RL для общих способностей, используя общую модель вознаграждения и правила. Модель также интегрирует агентные возможности, позволяя использовать инструменты и адаптировать рассуждения на основе обратной связи. QwQ-32B превосходит DeepSeek-R1-Distilled-Qwen-32B, DeepSeek-R1-Distilled-Llama-70B, o1-mini и сопоставима с оригинальным DeepSeek-R1. Модель с открытым весом доступна на Hugging Face и ModelScope под лицензией Apache 2.0, а также через Qwen Chat и API Alibaba Cloud DashScope.
- Сокращения
- RL = Reinforcement Learning — обучение с подкреплением
- AGI = Artificial General Intelligence — общий искусственный интеллект
- API = Application Programming Interface — интерфейс программирования приложений
Источник: Alibaba Qwen —
оригинал
