QwQ: глубокая рефлексия на границах неизвестного
Alibaba/Qwen
Команда Qwen из Alibaba представила экспериментальную модель QwQ-32B-Preview, нацеленную на стимулирование рассуждений в ИИ. Модель демонстрирует высокие результаты в математике и программировании, но имеет ограничения, включая смешение языков и рекурсивные циклы рассуждений.
Alibaba выпустила экспериментальную исследовательскую модель QwQ-32B-Preview (произносится как /kwju:/, похоже на слово quill). Модель предназначена для углублённого анализа и решения сложных задач в математике и кодировании. Она достигает 65,2% на бенчмарке GPQA (Graduate-Level Google-Proof Q&A Benchmark), 50,0% на AIME (American Invitation Mathematics Evaluation), 90,6% на MATH-500 и 50,0% на LiveCodeBench. Однако модель имеет ограничения: склонность к смешению языков и неожиданному переключению между ними, рекурсивные циклы рассуждений (циклические шаблоны, приводящие к длинным ответам без окончательного решения), требует усиленных мер безопасности, а также показывает более слабые результаты в задачах на здравый смысл и тонкое понимание языка. Разработчики подчёркивают, что это ранний этап, и модель продолжает учиться.
- Сокращения
- GPQA = Graduate-Level Google-Proof Q&A Benchmark — бенчмарк вопросов и ответов уровня магистратуры, устойчивый к поиску в Google
- AIME = American Invitation Mathematics Evaluation — Американская пригласительная математическая оценка
- MATH-500 = 500 test cases of the MATH benchmark — 500 тестовых случаев бенчмарка MATH
Источник: Alibaba Qwen —
оригинал
