Qwen3.8 Max: Alibaba's sterkste model raadt vaker en kost meer per taak
Alibaba/Qwen
Anthropic
Moonshot AI
Alibaba's Qwen3.8 Max behaalt 56 punten in de Artificial Analysis Intelligence Index, tien meer dan Qwen3.7 Max, en evenaart daarmee Claude Opus 4.8. Het is echter duurder per taak (1,14 dollar versus 0,53 dollar) en vertoont een hoger percentage hallucinaties (40 procent versus 23 procent) op de AA-Omniscience-test.
Alibaba's Qwen3.8 Max scoort 56 op de Artificial Analysis Intelligence Index, 10 punten meer dan Qwen3.7 Max (46). Volgens Artificial Analysis is het gelijkwaardig aan Claude Opus 4.8, loopt het voor op GLM-5.2 (51), maar blijft het achter op Kimi K3 (57), die ook 25% goedkoper werkt. In de GDPval-AA-workbenchmark stijgt Qwen met 468 Elo naar 1739, waarmee het Kimi K3 (1685) voorbijgaat, met alleen Claude Opus 5 (1852) als betere. Qwen3.8 Max vereist 64 in plaats van 14 werkstappen per taak, en het aantal invoertokens is 15-voudig toegenomen omdat de test bij elke stap de volledige gespreksgeschiedenis opnieuw verstuurt. Het model is grondiger maar langzamer en duurder. Hoewel de tokenprijzen zijn gedaald (invoer $2 tegen $2,50, uitvoer $6 tegen $7,50, cache-hit $0,25 tegen $0,50 per miljoen), kost één taak in de Intelligence Index $1,14, meer dan het dubbele van Qwen3.7 Max's $0,53. Kimi K3 kost $0,86 met één punt meer, GLM-5.2 $0,57. Vergeleken met zijn voorganger laat Qwen3.8 Max ook regressie zien op AA-LCR (-2 punten) en AA-Omniscience (-10 punten). Het hitpercentage blijft rond de 31%, maar het hallucinatiepercentage stijgt van 23% naar 40%, wat betekent dat Qwen3.8 Max vaker gokt in plaats van doorspeelt.
Bron: The Decoder (DE) —
origineel
