Qwen2.5: Pesta Model Fondasi!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
Tim Qwen dari Alibaba mengumumkan rilis sumber terbuka dari model bahasa besar Qwen2.5, bersama dengan model khusus untuk coding (Qwen2.5-Coder) dan matematika (Qwen2.5-Math). Model-model ini berkisar dari 0,5B hingga 72B parameter, dilatih sebelumnya hingga 18 triliun token, dengan peningkatan signifikan dalam pengetahuan, coding, dan kemampuan matematika. Rilis ini juga mencakup model API Qwen-Plus dan Qwen-Turbo.
Tim Qwen dari Alibaba merilis Qwen2.5, sebuah keluarga model bahasa decoder-only open-source, bersama dengan model khusus Qwen2.5-Coder dan Qwen2.5-Math. Model-model tersebut tersedia dalam ukuran dari 0,5B hingga 72B parameter, dilatih sebelumnya pada hingga 18 triliun token. Qwen2.5 mencapai MMLU 85+, HumanEval 85+, dan MATH 80+, mendukung konteks hingga 128K token dan generasi 8K, serta menawarkan dukungan multibahasa untuk lebih dari 29 bahasa. Qwen2.5-Coder dilatih pada 5,5 triliun token data kode, sementara Qwen2.5-Math mendukung penalaran CoT (Chain of Thought), PoT (Program of Thought), dan TIR (Tool-Integrated Reasoning). Model API andalan Qwen-Plus dan Qwen-Turbo juga ditawarkan. Varian 3B dan 72B tidak dilisensikan di bawah Apache 2.0.
Sumber: Alibaba Qwen —
asli
