МоделиИсследования 🇨🇳 28.07.2026 01:05

QwQ-32B: использование силы обучения с подкреплением

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwen представила модель QwQ-32B с 32 миллиардами параметров, которая достигает производительности, сравнимой с DeepSeek-R1 (671 миллиард параметров), благодаря масштабируемому обучению с подкреплением (RL). Модель опубликована с открытым исходным кодом под лицензией Apache 2.0 и сочетает возможности рассуждения с агентными функциями.
Alibaba представила модель QwQ-32B от Qwen, которая насчитывает 32 миллиарда параметров и использует масштабируемое обучение с подкреплением (reinforcement learning, RL). Модель демонстрирует производительность, сопоставимую с DeepSeek-R1, имеющей 671 миллиард параметров (из которых 37 миллиардов активны). Разработка основана на холодном старте и двухэтапном обучении с подкреплением: сначала на
Показать ещё ↓
Источник: Alibaba Qwen — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости