ModelleGeschäft & Markt 🇨🇳 28.07.2026 01:05

Qwen2.5-Max: Erkundung der Fähigkeiten eines groß angelegten MoE-Modells

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen hat Qwen2.5-Max veröffentlicht, ein großes Sprachmodell basierend auf der Mixture-of-Experts-Architektur, das mit über 20 Billionen Token trainiert wurde. Das Modell übertrifft DeepSeek V3 in mehreren Benchmarks und ist über die Alibaba Cloud APIs und Qwen Chat verfügbar.
Das Qwen-Team hat Qwen2.5-Max veröffentlicht, ein großes Sprachmodell, das auf der Mixture-of-Experts-Architektur (MoE) basiert und mit über 20 Billionen Token vortrainiert wurde. Nach dem Vortraining wurden überwachtes Fine-Tuning (Supervised Fine-Tuning, SFT) und Bestärkendes Lernen aus menschlichem Feedback (Reinforcement Learning from Human Feedback, RLHF) angewandt. Das Modell wurde mit DeepSeek V3, GPT-4o und Claude-3.5-Sonnet auf den Benchmarks MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard und GPQA-Diamond verglichen. Qwen2.5-Max übertraf DeepSeek V3 in Arena-Hard, LiveBench, LiveCodeBench und GPQA-Diamond, während es bei MMLU-Pro konkurrierende Ergebnisse zeigte. Für die Basis-Modelle wurden Vergleiche mit DeepSeek V3, Llama-3.1-405B und Qwen2.5-72B angestellt – Qwen2.5-Max zeigte in den meisten Tests deutliche Vorteile. Das Modell ist in Qwen Chat und über die Alibaba Cloud API (Modellname: qwen-max-2025-01-25) verfügbar. Die API ist mit der OpenAI-API kompatibel.
Quelle: Alibaba Qwen — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten