Qwen2.5:基盤モデルの祭典!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
AlibabaのQwenチームは、Qwen2.5 LLMのオープンソースリリースを発表し、コーディング向け(Qwen2.5-Coder)と数学向け(Qwen2.5-Math)の専門モデルも併せて公開しました。モデルは0.5Bから72Bパラメータまで、最大18兆トークンで事前学習され、知識、コーディング、数学の能力が大幅に向上しています。今回のリリースには、APIモデルであるQwen-PlusとQwen-Turboも含まれています。
AlibabaのQwenチームは、オープンソースのデコーダー専用言語モデルのファミリーであるQwen2.5を、専門モデルのQwen2.5-CoderおよびQwen2.5-Mathとともにリリースしました。モデルは0.5Bから72Bパラメーターのサイズで提供され、最大18兆トークンで事前学習されています。Qwen2.5はMMLU 85以上、HumanEval 85以上、MATH 80以上を達成し、最大128Kトークンのコンテキストと8Kの生成をサポートし、29以上の言語に対応する多言語サポートを提供します。Qwen2.5-Coderは5.5兆トークンのコードデータで学習され、Qwen2.5-MathはCoT(Chain-of-Thought)、PoT(Program-of-Thought)、TIR(Tool-Integrated Reasoning)の推論をサポートします。フラッグシップAPIモデルであるQwen-PlusとQwen-Turboも提供されています。3Bおよび72BバリアントはApache 2.0ライセンスではありません。
出典: Alibaba Qwen —
原文
