CoT), так и с помощью интегрированного инструментального мышления (Tool-Integrated Reasoning, TIR). TIR позволяет повысить точность вычислений и выполнять сложные алгоритмические операции. На бенчмарке MATH модели Qwen2.5-Math-1.5B/7B/72B-Instruct с TIR достигли 79,7, 85,3 и 87,8 баллов соответственно. Для предобучения использовался корпус Qwen Math Corpus v2 объёмом более 1 триллиона токенов. Модели 72B-Instruct превзошли GPT-4o и Gemini Math-Specialized 1.5 Pro, набрав 92,9 балла на MATH при TIR. Модель 7B-Instruct превзошла Qwen2-Math-72B-Instruct. На сложных олимпиадных тестах AIME 2024 и AMC 2023 модели также показали высокие результаты. Проведена деконтаминация данных для избежания утечки. Демо-версия доступна с поддержкой TIR.