Alibaba brengt Qwen2.5-Math uit: geavanceerde open-source wiskundige LLM's
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba heeft Qwen2.5-Math geïntroduceerd, een nieuwe serie open-source wiskundige taalmodellen, variërend van 1,5B tot 72B parameters. De modellen ondersteunen het oplossen van wiskundige problemen in het Engels en Chinees met behulp van keten van redeneren en geïntegreerd gereedschapsgebruik, en overtreffen daarmee aanzienlijk de vorige generatie Qwen2-Math.
Alibaba heeft Qwen2.5-Math uitgebracht — een nieuwe serie open wiskundige LLM's, bestaande uit de basismodellen Qwen2.5-Math-1.5B/7B/72B, instructieversies en een wiskundig beloningsmodel Qwen2.5-Math-RM-72B. In tegenstelling tot Qwen2-Math ondersteunen de nieuwe modellen het oplossen van problemen in het Engels en Chinees, zowel via een keten van redeneringen (chain of thought, CoT) als via geïntegreerd instrumenteel denken (tool-integrated reasoning, TIR). TIR maakt het mogelijk om de nauwkeurigheid van berekeningen te verbeteren en complexe algoritmische operaties uit te voeren. Op de MATH-benchmark behaalden de Qwen2.5-Math-1.5B/7B/72B-Instruct modellen met TIR respectievelijk 79,7, 85,3 en 87,8 punten. Voor pretraining werd de Qwen Math Corpus v2 gebruikt, met een volume van meer dan 1 biljoen tokens. De 72B-Instruct modellen overtroffen GPT-4o en Gemini Math-Specialized 1.5 Pro met een score van 92,9 op MATH met TIR. Het 7B-Instruct model overtrof Qwen2-Math-72B-Instruct. Op de complexe olympiade-toetsen AIME 2024 en AMC 2023 behaalden de modellen ook hoge resultaten. Er is gegevensdecontaminatie uitgevoerd om datalekken te voorkomen. Een demoversie is beschikbaar met ondersteuning voor TIR.
Bron: Alibaba Qwen —
origineel
