Qwen2.5-Max:大規模MoEモデルの能力を探る
Alibaba/Qwen
アリババのQwenは、Mixture-of-Expertsアーキテクチャに基づく大規模言語モデルQwen2.5-Maxをリリースしました。このモデルは20兆以上のトークンでトレーニングされ、いくつかのベンチマークでDeepSeek V3を上回る性能を示しています。Alibaba CloudのAPIとQwen Chatを通じて利用可能です。
Qwenチームは、Mixture-of-Experts(MoE)アーキテクチャに基づく大規模言語モデルQwen2.5-Maxを公開しました。このモデルは20兆以上のトークンで事前学習され、その後、教師ありファインチューニング(SFT)と人間のフィードバックからの強化学習(RLHF)が適用されています。Qwen2.5-Maxは、DeepSeek V3、GPT-4o、Claude-3.5-Sonnetと比較され、MMLU-Pro、LiveCodeBench、LiveBench、Arena-Hard、GPQA-Diamondの各ベンチマークで評価されました。Arena-Hard、LiveBench、LiveCodeBench、GPQA-DiamondではDeepSeek V3を上回り、MMLU-Proでは競争力のある結果を示しました。ベースモデルの比較では、DeepSeek V3、Llama-3.1-405B、Qwen2.5-72Bとの対比で、Qwen2.5-Maxはほとんどのテストで顕著な優位性を示しました。このモデルはQwen ChatおよびAlibaba Cloud API(モデル名:qwen-max-2025-01-25)で利用可能です。APIはOpenAI APIと互換性があります。
出典: Alibaba Qwen —
原文
