Alibaba lanza Qwen2.5-Math: avanzados modelos de lenguaje matemático de código abierto
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba presentó Qwen2.5-Math, una nueva serie de modelos de lenguaje matemático de código abierto, que incluye modelos desde 1,5B hasta 72B parámetros. Los modelos admiten la resolución de problemas matemáticos en inglés y chino utilizando razonamiento en cadena y pensamiento con herramientas integradas, superando significativamente a la generación anterior Qwen2-Math.
Alibaba ha lanzado Qwen2.5-Math, una nueva serie de modelos de lenguaje grandes (LLM) matemáticos de código abierto, que incluye los modelos base Qwen2.5-Math-1.5B/7B/72B, versiones instructivas y un modelo de recompensa matemática Qwen2.5-Math-RM-72B. A diferencia de Qwen2-Math, los nuevos modelos admiten la resolución de problemas en inglés y chino tanto mediante cadenas de razonamiento (CoT) como mediante razonamiento integrado con herramientas (TIR). El TIR permite mejorar la precisión de los cálculos y realizar operaciones algorítmicas complejas. En el punto de referencia MATH, los modelos Qwen2.5-Math-1.5B/7B/72B-Instruct con TIR alcanzaron puntuaciones de 79.7, 85.3 y 87.8, respectivamente. Para el preentrenamiento se utilizó el corpus Qwen Math Corpus v2 con más de 1 billón de tokens. Los modelos de 72B-Instruct superaron a GPT-4o y Gemini Math-Specialized 1.5 Pro, obteniendo 92.9 puntos en MATH con TIR. El modelo de 7B-Instruct superó a Qwen2-Math-72B-Instruct. En los exigentes exámenes de olimpiadas AIME 2024 y AMC 2023, los modelos también mostraron altos rendimientos. Se realizó una descontaminación de datos para evitar fugas. La demo está disponible con soporte para TIR.
Fuente: Alibaba Qwen —
original
