Alibaba выпускает Qwen2.5-Math: передовые открытые математические LLM
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba представила Qwen2.5-Math, новую серию открытых математических языковых моделей, включающую модели от 1,5B до 72B параметров. Модели поддерживают решение математических задач на английском и китайском языках с использованием цепочки рассуждений и интегрированного инструментального мышления, значительно превосходя предыдущее поколение Qwen2-Math.
Alibaba выпустила Qwen2.5-Math — новую серию открытых математических LLM, включающую базовые модели Qwen2.5-Math-1.5B/7B/72B, инструктивные версии и математическую модель вознаграждения Qwen2.5-Math-RM-72B. В отличие от Qwen2-Math, новые модели поддерживают решение задач на английском и китайском языках как с помощью цепочки рассуждений (CoT), так и с помощью интегрированного инструментального мышления (TIR). TIR позволяет повысить точность вычислений и выполнять сложные алгоритмические операции. На бенчмарке MATH модели Qwen2.5-Math-1.5B/7B/72B-Instruct с TIR достигли 79,7, 85,3 и 87,8 баллов соответственно. Для предобучения использовался корпус Qwen Math Corpus v2 объёмом более 1 трлн токенов. Модели 72B-Instruct превзошли GPT-4o и Gemini Math-Specialized 1.5 Pro, набрав 92,9 балла на MATH при TIR. Модель 7B-Instruct превзошла Qwen2-Math-72B-Instruct. На сложных олимпиадных тестах AIME 2024 и AMC 2023 модели также показали высокие результаты. Проведена деконтаминация данных для избежания утечки. Демо-версия доступна с поддержкой TIR.
- Сокращения
- CoT = Chain-of-Thought — цепочка рассуждений
- TIR = Tool-Integrated Reasoning — интегрированное инструментальное мышление
- LLM = Large Language Model — большая языковая модель
- RM = Reward Model — модель вознаграждения
- SFT = Supervised Fine-Tuning — контролируемая тонкая настройка
- RL = Reinforcement Learning — обучение с подкреплением
- OCR = Optical Character Recognition — оптическое распознавание символов
Source: Alibaba Qwen —
original
