Alibaba veröffentlicht Qwen2.5-Math: führende offene Mathematik-LLMs
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba hat Qwen2.5-Math vorgestellt, eine neue Serie offener mathematischer Sprachmodelle, die Modelle von 1,5 Milliarden bis 72 Milliarden Parametern umfasst. Die Modelle unterstützen das Lösen mathematischer Aufgaben auf Englisch und Chinesisch mithilfe von Überlegungsketten und integriertem Werkzeugdenken und übertreffen die vorherige Generation Qwen2-Math deutlich.
Alibaba hat Qwen2.5-Math veröffentlicht, eine neue Reihe offener Mathematik-LLMs, die die Basismodelle Qwen2.5-Math-1.5B/7B/72B, instruktionsoptimierte Versionen und das mathematische Belohnungsmodell Qwen2.5-Math-RM-72B umfasst. Im Gegensatz zu Qwen2-Math unterstützen die neuen Modelle das Lösen von Aufgaben in Englisch und Chinesisch sowohl mittels Chain-of-Thought (CoT) als auch mittels integriertem Tool-Integrated Reasoning (TIR). TIR ermöglicht eine verbesserte Rechengenauigkeit und die Durchführung komplexer algorithmischer Operationen. Im MATH-Benchmark erreichten die Modelle Qwen2.5-Math-1.5B/7B/72B-Instruct mit TIR Werte von 79,7, 85,3 bzw. 87,8 Punkten. Für das Pretraining wurde der Qwen Math Corpus v2 mit einem Volumen von über einer Billion Tokens verwendet. Die Modelle 72B-Instruct übertrafen GPT-4o und Gemini Math-Specialized 1.5 Pro und erzielten im MATH-Test mit TIR 92,9 Punkte. Das Modell 7B-Instruct übertraf Qwen2-Math-72B-Instruct. Auch bei den komplexen Olympiade-Tests AIME 2024 und AMC 2023 zeigten die Modelle hohe Ergebnisse. Es wurde eine Dekontamination der Daten durchgeführt, um Datenlecks zu vermeiden. Eine Demo-Version ist mit TIR-Unterstützung verfügbar.
Quelle: Alibaba Qwen —
Original
