Alibaba julkaisee Qwen2.5-Coder: jopa 32 miljardia parametria, avoimen lähdekoodin koodimallit
Alibaba/Qwen
DeepSeek
Mistral
Alibaban Qwen-tiimi julkistaa Qwen2.5-Coderin, seuraavan sukupolven avoimen lähdekoodin koodimallisarjan 1,5B-, 7B- ja tulevassa 32B-koossa, koulutettuna 5,5 biljoonalla tokenilla. 7B-versio ylittää suuremmat mallit, kuten DeepSeek-Coder-V2-Lite ja CodeStral-22B, kooditehtävissä, samalla kun se säilyttää vahvat matemaattiset ja yleiset kyvyt.
Alibaban Qwen-tiimi julkaisi Qwen2.5-Coder-mallin, CodeQwen1.5:n seuraajan, osana Qwen2.5-sarjaa. Mallit ovat saatavilla kolmessa koossa: 1,5B, 7B ja pian ilmestyvä 32B-versio. Ne on koulutettu 5,5 biljoonalla tokenilla, mukaan lukien lähdekoodi, teksti-koodi -maadoitusaineisto ja synteettinen data, sekä ylimääräinen matematiikka- ja yleisdata koodaustaidoista riippumattomien kykyjen säilyttämiseksi. Perusmalli tukee enintään 128 000 tokenin kontekstia, 92 ohjelmointikieltä ja saavuttaa alan johtavia tuloksia koodin tuottamisessa, täydentämisessä, korjaamisessa ja monikielisissä vertailuarvoissa. 7B-versio päihittää DeepSeek-Coder-V2-Lite- ja CodeStral-22B-mallit kooditehtävissä ja osoittaa myös kilpailukykyistä matematiikan suorituskykyä GSM8K- ja Math-arvioinneissa. Ohjeella hienosäädetty variantti Qwen2.5-Coder-Instruct parantaa edelleen tehtäväsuoritusta ja yleistyskykyä, loistaen monikielisessä koodipäättelyssä (McEval), koodipäättelyssä (CRUXEval) ja matematiikan päättelyssä (GSM8K, OlympiadBench). Se säilyttää myös vahvat yleiset kyvyt MMLU-, CEval- ja muissa vertailuarvoissa. Mallit on julkaistu Apache 2.0 -lisenssillä. Seuraavia vaiheita ovat 32B-versio ja koodikeskeisten päättelymallien tutkiminen.
Lähde: Alibaba Qwen —
Alkuperäinen
