ModelsOpen Source 🇨🇳 28.07.2026 18:03

Alibaba выпускает Qwen2.5-Math: передовые открытые математические LLM

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI Google/DeepMindGoogle/DeepMind AnthropicAnthropic
Alibaba представила Qwen2.5-Math, новую серию открытых математических языковых моделей, включающую модели от 1,5B до 72B параметров. Модели поддерживают решение математических задач на английском и китайском языках с использованием цепочки рассуждений и интегрированного инструментального мышления, значительно превосходя предыдущее поколение Qwen2-Math.
Alibaba выпустила Qwen2.5-Math — новую серию открытых математических LLM, включающую базовые модели Qwen2.5-Math-1.5B/7B/72B, инструктивные версии и математическую модель вознаграждения Qwen2.5-Math-RM-72B. В отличие от Qwen2-Math, новые модели поддерживают решение задач на английском и китайском языках как с помощью цепочки рассуждений (CoT), так и с помощью интегрированного инструментального мышления (TIR). TIR позволяет повысить точность вычислений и выполнять сложные алгоритмические операции. На бенчмарке MATH модели Qwen2.5-Math-1.5B/7B/72B-Instruct с TIR достигли 79,7, 85,3 и 87,8 баллов соответственно. Для предобучения использовался корпус Qwen Math Corpus v2 объёмом более 1 трлн токенов. Модели 72B-Instruct превзошли GPT-4o и Gemini Math-Specialized 1.5 Pro, набрав 92,9 балла на MATH при TIR. Модель 7B-Instruct превзошла Qwen2-Math-72B-Instruct. На сложных олимпиадных тестах AIME 2024 и AMC 2023 модели также показали высокие результаты. Проведена деконтаминация данных для избежания утечки. Демо-версия доступна с поддержкой TIR.
Сокращения
CoT = Chain-of-Thought — цепочка рассуждений
TIR = Tool-Integrated Reasoning — интегрированное инструментальное мышление
LLM = Large Language Model — большая языковая модель
RM = Reward Model — модель вознаграждения
SFT = Supervised Fine-Tuning — контролируемая тонкая настройка
RL = Reinforcement Learning — обучение с подкреплением
OCR = Optical Character Recognition — оптическое распознавание символов
Source: Alibaba Qwen — original
Our earlier posts on this topic ↓
Fresh news