Qwen2.5-Max:探索大规模 MoE 模型的能力
Alibaba/Qwen
阿里云通义千问发布了 Qwen2.5-Max,这是一个基于混合专家架构的大型语言模型,在超过 20 万亿个 token 上进行了训练。该模型在多个基准测试上优于 DeepSeek V3,并可通过阿里云 API 和 Qwen Chat 使用。
Qwen团队发布了Qwen2.5-Max,这是一款基于混合专家(MoE)架构的大型语言模型,在超过20万亿个token上进行了预训练。预训练后,进行了监督微调(SFT)和基于人类反馈的强化学习(RLHF)。该模型在MMLU-Pro、LiveCodeBench、LiveBench、Arena-Hard和GPQA-Diamond基准上,与DeepSeek V3、GPT-4o和Claude-3.5-Sonnet进行了比较。Qwen2.5-Max在Arena-Hard、LiveBench、LiveCodeBench和GPQA-Diamond上优于DeepSeek V3,在MMLU-Pro上表现相当。在基础模型方面,与DeepSeek V3、Llama-3.1-405B和Qwen2.5-72B进行了比较——Qwen2.5-Max在大多数测试中展现出显著优势。该模型可在Qwen Chat中使用,也可通过阿里云API(模型名称:qwen-max-2025-01-25)访问。API与OpenAI API兼容。
来源: Alibaba Qwen —
原文
