Alibaba veröffentlicht Qwen2.5-Math: führende offene mathematische LLMs
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba hat Qwen2.5-Math vorgestellt, eine neue Serie offener mathematischer Sprachmodelle mit einer Größe von 1,5B bis 72B Parametern. Die Modelle unterstützen das Lösen von mathematischen Aufgaben auf Englisch und Chinesisch mithilfe von Kettendenkens und integrierten Werkzeugdenkens und übertreffen damit die vorherige Generation Qwen2-Math deutlich.
Alibaba hat Qwen2.5-Math veröffentlicht, eine neue Reihe offener Mathematik-LLMs, die die Basismodelle Qwen2.5-Math-1.5B/7B/72B, instruktionsoptimierte Versionen und das mathematische Belohnungsmodell Qwen2.5-Math-RM-72B umfasst. Im Gegensatz zu Qwen2-Math unterstützen die neuen Modelle das Lösen von Aufgaben in Englisch und Chinesisch sowohl mittels Chain-of-Thought (CoT) als auch mittels integriertem Tool-Integrated Reasoning (TIR). TIR ermöglicht eine verbesserte Rechengenauigkeit und die Durchführung komplexer algorithmischer Operationen. Im MATH-Benchmark erreichten die Modelle Qwen2.5-Math-1.5B/7B/72B-Instruct mit TIR Werte von 79,7, 85,3 bzw. 87,8 Punkten. Für das Pretraining wurde der Qwen Math Corpus v2 mit einem Volumen von über einer Billion Tokens verwendet. Die Modelle 72B-Instruct übertrafen GPT-4o und Gemini Math-Specialized 1.5 Pro und erzielten im MATH-Test mit TIR 92,9 Punkte. Das Modell 7B-Instruct übertraf Qwen2-Math-72B-Instruct. Auch bei den komplexen Olympiade-Tests AIME 2024 und AMC 2023 zeigten die Modelle hohe Ergebnisse. Es wurde eine Dekontamination der Daten durchgeführt, um Datenlecks zu vermeiden. Eine Demo-Version ist mit TIR-Unterstützung verfügbar.
Quelle: Alibaba Qwen —
Original
