ModèlesAffaires et Marché 🇨🇳 28.07.2026 01:05

Qwen2.5-Max : exploration des capacités d’un modèle MoE à grande échelle

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen a publié Qwen2.5-Max, un grand modèle de langage basé sur l'architecture Mixture-of-Experts, entraîné sur plus de 20 billions de tokens. Ce modèle surpasse DeepSeek V3 sur plusieurs références et est disponible via les API d'Alibaba Cloud et Qwen Chat.
L'équipe de Qwen a publié Qwen2.5-Max, un modèle de langage de grande taille basé sur l'architecture Mixture-of-Experts (MoE), pré-entraîné sur plus de 20 000 milliards de tokens. Après le pré-entraînement, un ajustement supervisé (SFT) et un apprentissage par renforcement à partir du feedback humain (RLHF) ont été appliqués. Le modèle a été comparé à DeepSeek V3, GPT-4o et Claude-3.5-Sonnet sur les benchmarks MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard et GPQA-Diamond. Qwen2.5-Max surpasse DeepSeek V3 dans Arena-Hard, LiveBench, LiveCodeBench et GPQA-Diamond, tout en montrant des résultats compétitifs dans MMLU-Pro. Pour les modèles de base, des comparaisons ont été faites avec DeepSeek V3, Llama-3.1-405B et Qwen2.5-72B — Qwen2.5-Max a démontré des avantages significatifs dans la plupart des tests. Le modèle est disponible dans Qwen Chat et via l'API d'Alibaba Cloud (nom du modèle : qwen-max-2025-01-25). L'API est compatible avec l'API OpenAI.
Source: Alibaba Qwen — original
Nos articles précédents sur ce sujet ↓
Infos fraîches