Qwen2.5-Max: Explorando as Capacidades de um Modelo MoE de Grande Escala
Alibaba/Qwen
A Alibaba Qwen lançou o Qwen2.5-Max, um grande modelo de linguagem baseado na arquitetura Mixture-of-Experts, treinado em mais de 20 trilhões de tokens. O modelo supera o DeepSeek V3 em vários benchmarks e está disponível por meio das APIs da Alibaba Cloud e do Qwen Chat.
A equipe Qwen lançou o Qwen2.5-Max, um modelo de linguagem de grande porte baseado na arquitetura Mixture-of-Experts (MoE), pré-treinado em mais de 20 trilhões de tokens. Após o pré-treinamento, foram aplicados fine-tuning supervisionado (supervised fine-tuning, SFT) e aprendizado por reforço com feedback humano (reinforcement learning from human feedback, RLHF). O modelo foi comparado com DeepSeek V3, GPT-4o e Claude-3.5-Sonnet nos benchmarks MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard e GPQA-Diamond. O Qwen2.5-Max superou o DeepSeek V3 em Arena-Hard, LiveBench, LiveCodeBench e GPQA-Diamond, enquanto apresentou resultados competitivos no MMLU-Pro. Para os modelos base, foram feitas comparações com DeepSeek V3, Llama-3.1-405B e Qwen2.5-72B — o Qwen2.5-Max demonstrou vantagens significativas na maioria dos testes. O modelo está disponível no Qwen Chat e por meio da API da Alibaba Cloud (nome do modelo: qwen-max-2025-01-25). A API é compatível com a API da OpenAI.
Fonte: Alibaba Qwen —
original
