⚡ МОЛНИЯ
Qwen3: думай глубже, действуй быстрее
Alibaba/Qwen
DeepSeek
OpenAI
xAI
Google/DeepMind
Компания Alibaba (Qwen) выпустила семейство языковых моделей Qwen3, включая флагманскую Qwen3-235B-A22B с 235 млрд параметров (22 млрд активных), которая конкурирует с DeepSeek-R1, o1, o3-mini, Grok-3 и Gemini-2.5-Pro. Все модели открыты под лицензией Apache 2.0. Qwen3 поддерживает два режима мышления — размышляющий (step-by-step) и быстрый (без размышлений), а также 119 языков.
Alibaba Qwen представила Qwen3 — новое поколение больших языковых моделей. Флагманская Qwen3-235B-A22B (235 млрд параметров, 22 млрд активных) показывает конкурентоспособные результаты в бенчмарках по кодингу, математике и общим задачам, соперничая с DeepSeek-R1, o1, o3-mini, Grok-3 и Gemini-2.5-Pro. Меньшая MoE-модель Qwen3-30B-A3B (30 млрд параметров, 3 млрд активных) превосходит QwQ-32B при в 10 раз меньшем числе активных параметров, а крошечная Qwen3-4B может соперничать с Qwen2.5-72B-Instruct. Открыты веса двух MoE-моделей (Qwen3-235B-A22B и Qwen3-30B-A3B) и шести плотных моделей (от 0.6B до 32B) под лицензией Apache 2.0. Ключевая особенность — гибридные режимы мышления: Thinking Mode (пошаговое рассуждение для сложных задач) и Non-Thinking Mode (мгновенные ответы для простых вопросов). Модели поддерживают 119 языков и диалектов. Улучшены агентные способности, включая поддержку MCP (Model Context Protocol). Предобучение проведено на 36 трлн токенов (вдвое больше, чем у Qwen2.5) в три этапа: базовое обучение на 30+ трлн токенов (длина контекста 4K), дообучение на 5 трлн токенов с упором на STEM и кодинг, затем расширение контекста до 32K токенов. Пост-обучение включало четыре этапа: холодный старт с длинной цепочкой рассуждений, RL на основе правил, слияние режимов мышления и общее RL. Для развёртывания рекомендуются SGLang, vLLM, Ollama, LMStudio, MLX, llama.cpp, KTransformers.
- Сокращения
- MoE = Mixture of Experts — смесь экспертов
- RL = Reinforcement Learning — обучение с подкреплением
- MCP = Model Context Protocol — протокол контекста модели
- STEM = Science, Technology, Engineering, Mathematics — наука, технологии, инженерия, математика
- CoT = Chain of Thought — цепочка рассуждений
Источник: Alibaba Qwen —
оригинал
