ModelosNegocios y Mercado 🇨🇳 28.07.2026 01:05

Qwen2.5-Max: Explorando las Capacidades de un Modelo MoE a Gran Escala

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen lanzó Qwen2.5-Max, un modelo de lenguaje grande basado en la arquitectura Mezcla de Expertos (MoE), entrenado con más de 20 billones de tokens. El modelo supera a DeepSeek V3 en varios puntos de referencia y está disponible a través de las API de Alibaba Cloud y Qwen Chat.
El equipo de Qwen ha lanzado Qwen2.5-Max, un modelo de lenguaje de gran tamaño basado en la arquitectura de mezcla de expertos (MoE, por sus siglas en inglés), preentrenado con más de 20 billones de tokens. Tras el preentrenamiento, se aplicaron ajuste fino supervisado (SFT, por sus siglas en inglés) y aprendizaje por refuerzo con retroalimentación humana (RLHF, por sus siglas en inglés). El modelo se comparó con DeepSeek V3, GPT-4o y Claude-3.5-Sonnet en los puntos de referencia MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard y GPQA-Diamond. Qwen2.5-Max superó a DeepSeek V3 en Arena-Hard, LiveBench, LiveCodeBench y GPQA-Diamond, mientras que mostró resultados competitivos en MMLU-Pro. Para los modelos base, se realizaron comparaciones con DeepSeek V3, Llama-3.1-405B y Qwen2.5-72B; Qwen2.5-Max demostró ventajas significativas en la mayoría de las pruebas. El modelo está disponible en Qwen Chat y a través de la API de Alibaba Cloud (nombre del modelo: qwen-max-2025-01-25). La API es compatible con la API de OpenAI.
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas