ModelleGeschäft & Markt 🇩🇪 06.08.2026 16:01

Qwen3.8 Max: Alibabas stärkstes Modell rät häufiger und kostet mehr pro Aufgabe

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
Alibabas Qwen3.8 Max erreicht 56 Punkte im Artificial Analysis Intelligence Index, 10 mehr als Qwen3.7 Max, und liegt damit gleichauf mit Claude Opus 4.8. Allerdings ist es pro Aufgabe teurer (1,14 US-Dollar gegenüber 0,53 US-Dollar) und zeigt erhöhte Halluzinationsraten (40 Prozent gegenüber 23 Prozent) im AA-Omniscience-Test.
Alibabas Qwen3.8 Max erreicht im Artificial Analysis Intelligence Index 56 Punkte, 10 Punkte mehr als Qwen3.7 Max (46). Laut Artificial Analysis liegt es damit auf Augenhöhe mit Claude Opus 4.8, vor GLM-5.2 (51), aber hinter Kimi K3 (57), das zudem 25 % günstiger ist. Im GDPval-AA-Arbeitsbenchmark steigt Qwen um 468 Elo-Punkte auf 1739 und übertrifft damit Kimi K3 (1685); nur Claude Opus 5 (1852) ist besser. Qwen3.8 Max benötigt 64 statt 14 Arbeitsschritte pro Aufgabe, und die Eingabetoken haben sich um das 15-fache erhöht, da der Test bei jedem Schritt den gesamten bisherigen Gesprächsverlauf erneut sendet. Das Modell ist gründlicher, aber langsamer und teurer. Obwohl die Token-Preise gesunken sind (Eingabe 2 $ statt 2,50 $, Ausgabe 6 $ statt 7,50 $, Cache-Treffer 0,25 $ statt 0,50 $ pro Million), kostet eine Aufgabe im Intelligence Index 1,14 $ – mehr als doppelt so viel wie die 0,53 $ von Qwen3.7 Max. Kimi K3 kostet 0,86 $ bei einem Punkt mehr, GLM-5.2 0,57 $. Im Vergleich zum Vorgänger verschlechtert sich Qwen3.8 Max auch bei AA-LCR (minus 2 Punkte) und AA-Omniscience (minus 10 Punkte). Die Trefferquote bleibt bei etwa 31 %, aber die Halluzinationsrate steigt von 23 % auf 40 %, was bedeutet, dass Qwen3.8 Max häufiger rät, anstatt zu übergeben.
Quelle: The Decoder (DE) — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten