Qwen2.5-LLM: Memperluas Batasan Model Bahasa
Alibaba/Qwen
Tim Qwen dari Alibaba telah merilis seri model bahasa Qwen2.5, termasuk tujuh model sumber terbuka dengan parameter mulai dari 0,5B hingga 72B. Model-model ini memiliki dataset pra-pelatihan yang lebih besar (hingga 18 triliun token), peningkatan kemampuan pengetahuan, pengodean, dan matematika, serta mendukung panjang konteks hingga 128K token.
Tim Qwen dari Alibaba mengumumkan seri model bahasa Qwen2.5, yaitu model padat decoder-only. Tujuh model dirilis sebagai sumber terbuka: 0,5 Miliar, 1,5 Miliar, 3 Miliar, 7 Miliar, 14 Miliar, 32 Miliar, dan 72 Miliar parameter. Dataset prapelatihan diperluas dari 7 triliun menjadi 18 triliun token. Dibandingkan dengan Qwen2, Qwen2.5 menunjukkan peningkatan dalam MMLU, tolok ukur pengkodean (LiveCodeBench, MultiPL-E, MBPP), dan tolok ukur matematika (MATH). Qwen2.5-72B mengungguli Llama-3-405B dalam beberapa tugas meskipun hanya menggunakan seperlima parameter. Model tambahan Qwen-Plus dan Qwen-Turbo tersedia melalui Alibaba Cloud Model Studio API. Sebagian besar model dilisensikan di bawah Apache 2.0, kecuali Qwen2.5-3B dan Qwen2.5-72B yang memiliki lisensi terpisah.
Sumber: Alibaba Qwen —
asli
