ModellenBedrijf & Markt 🇨🇳 28.07.2026 01:05

Qwen2.5-Max: De Mogelijkheden van een Groot-MoE-Model

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen heeft Qwen2.5-Max uitgebracht, een groot taalmodel gebaseerd op de Mixture-of-Experts-architectuur, getraind op meer dan 20 biljoen tokens. Het model presteert beter dan DeepSeek V3 op verschillende benchmarks en is beschikbaar via Alibaba Cloud API's en Qwen Chat.
Het Qwen-team heeft Qwen2.5-Max uitgebracht, een groot taalmodel gebaseerd op de Mixture-of-Experts (MoE)-architectuur, getraind op meer dan 20 biljoen tokens. Na de pre-training werden supervised fine-tuning (SFT) en reinforcement learning from human feedback (RLHF) toegepast. Het model werd vergeleken met DeepSeek V3, GPT-4o en Claude-3.5-Sonnet op de benchmarks MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard en GPQA-Diamond. Qwen2.5-Max presteerde beter dan DeepSeek V3 in Arena-Hard, LiveBench, LiveCodeBench en GPQA-Diamond, terwijl het concurrerende resultaten liet zien in MMLU-Pro. Voor de basismodellen werden vergelijkingen gemaakt met DeepSeek V3, Llama-3.1-405B en Qwen2.5-72B – Qwen2.5-Max toonde aanzienlijke voordelen in de meeste tests. Het model is beschikbaar via Qwen Chat en via de Alibaba Cloud API (modelnaam: qwen-max-2025-01-25). De API is compatibel met de OpenAI API.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws