Alibaba julkistaa Qwen2.5-Math: edistyneet avoimet matematiikan LLM-mallit
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
Alibaba on julkaissut Qwen2.5-Math, uuden sarjan avoimia matematiikan kielimalleja, jotka sisältävät malleja 1,5B:stä 72B parametriin. Mallit tukevat matematiikan ongelmien ratkaisua englanniksi ja kiinaksi käyttäen päättelyketjua ja integroitua työkaluajattelua, ylittäen selvästi edellisen sukupolven Qwen2-Math-mallit.
Alibaba on julkaissut Qwen2.5-Math -sarjan, uuden avoimen matematiikan LLM-perheen, johon kuuluvat perusmallit Qwen2.5-Math-1.5B/7B/72B, niiden ohjeistetut versiot sekä matemaattinen palkkiomalli Qwen2.5-Math-RM-72B. Toisin kuin Qwen2-Math, uudet mallit tukevat tehtävien ratkaisemista englanniksi ja kiinaksi sekä päättelyketjun (Chain of Thought, CoT) että integroidun työkalupohjaisen päättelyn (Tool-integrated Reasoning, TIR) avulla. TIR mahdollistaa laskutoimitusten tarkkuuden parantamisen ja monimutkaisten algoritmisten operaatioiden suorittamisen. MATH-testissä Qwen2.5-Math-1.5B/7B/72B-Instruct -mallit saavuttivat TIR:n avulla pisteet 79,7, 85,3 ja 87,8. Esikoulutukseen käytettiin Qwen Math Corpus v2 -korhosta, jonka koko on yli biljoona tokenia. 72B-Instruct-mallit ohittivat GPT-4o:n ja Gemini Math-Specialized 1.5 Pron saavuttaen 92,9 pistettä MATH-testissä TIR:n avulla. 7B-Instruct-malli ohitti Qwen2-Math-72B-Instructin. Vaativissa olympiatason testeissä AIME 2024 ja AMC 2023 mallit saavuttivat myös korkeita tuloksia. Tietovuodon välttämiseksi suoritettiin datan dekontaminaatio. Demoversio on saatavilla TIR-tuella.
Lähde: Alibaba Qwen —
Alkuperäinen
