Qwen2.5: Perustamallien juhlaa!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
Alibaban Qwen-tiimi ilmoittaa Qwen2.5-kielimallien avoimen lähdekoodin julkaisusta yhdessä koodaukseen (Qwen2.5-Coder) ja matematiikkaan (Qwen2.5-Math) erikoistuneiden mallien kanssa. Mallit vaihtelevat 0,5 miljardista 72 miljardiin parametriin, ja ne on esikoulutettu jopa 18 biljoonalla tokenilla, mikä tuo merkittäviä parannuksia tietämykseen, koodaukseen ja matematiikkaan. Julkaisuun kuuluvat myös API-mallit Qwen-Plus ja Qwen-Turbo.
Aliyhtymän (Alibaban) Qwen-tiimi julkaisi Qwen2.5-perheen, joka koostuu avoimen lähdekoodin dekooderipohjaisista kielimalleista, sekä erikoistuneista malleista Qwen2.5-Coder ja Qwen2.5-Math. Mallit ovat saatavilla 0,5B-72B parametrin kokoisina ja ne on esikoulutettu jopa 18 biljoonalla tokenilla. Qwen2.5 saavuttaa MMLU:ssa yli 85 pistettä, HumanEvalissa yli 85 pistettä ja MATHissa yli 80 pistettä, tukee jopa 128 000 tokenin kontekstia ja 8000 tokenin tuottamista, ja tarjoaa monikielistä tukea yli 29 kielelle. Qwen2.5-Coder on koulutettu 5,5 biljoonalla koodidatan tokenilla, kun taas Qwen2.5-Math tukee CoT-, PoT- ja TIR-päättelyä (CoT, engl. chain-of-thought, päättelyketju; PoT, engl. program-of-thought, ohjelmallinen päättely; TIR, engl. tool-integrated reasoning, työkaluintegroitu päättely). Lisäksi tarjolla on lippulaivamallit Qwen-Plus ja Qwen-Turbo API-rajapinnan kautta. 3B- ja 72B-versiot eivät ole Apache 2.0 -lisenssin alaisia.
Lähde: Alibaba Qwen —
Alkuperäinen
