Qwen3.8 Max: Alibaban vahvin malli useammin arvailee ja maksaa enemmän per tehtävä
Alibaba/Qwen
Anthropic
Moonshot AI
Alibaban Qwen3.8 Max saavuttaa 56 pistettä Artificial Analysis -älykkyysindeksissä, 10 pistettä enemmän kuin Qwen3.7 Max, sivuten Claude Opus 4.8:aa. Se on kuitenkin kalliimpi per tehtävä (1,14 dollaria verrattuna 0,53 dollariin) ja osoittaa lisääntynyttä hallusinaatioastetta (40 prosenttia verrattuna 23 prosenttiin) AA-Omniscience-testissä.
Alibaban Qwen3.8 Max saa Artificial Analysis -indeksissä 56 pistettä, mikä on 10 pistettä enemmän kuin Qwen3.7 Max (46). Artificial Analysisin mukaan se on samalla tasolla Claude Opus 4.8:n kanssa, edellä GLM-5.2:ta (51), mutta jäljessä Kimi K3:sta (57), joka toimii myös 25 prosenttia halvemmalla. GDPval-AA-työvertailussa Qwen hyppää 468 Elo-pistettä arvoon 1739, ohittaen Kimi K3:n (1685), ja vain Claude Opus 5 (1852) on parempi. Qwen3.8 Max vaatii 64 työvaihetta tehtävää kohden aiemman 14 sijaan, ja syöttötokenit kasvoivat 15-kertaisiksi, koska testi lähettää koko keskusteluhistorian uudelleen jokaisessa vaiheessa. Malli on perusteellisempi mutta hitaampi ja kalliimpi. Vaikka token-hinnat laskivat (syöttö 2 dollaria vs. 2,50 dollaria, tuloste 6 dollaria vs. 7,50 dollaria, välimuistiosuma 0,25 dollaria vs. 0,50 dollaria miljoonalta), yksi tehtävä älykkyysindeksissä maksaa 1,14 dollaria, mikä on yli kaksinkertainen Qwen3.7 Maxin 0,53 dollariin verrattuna. Kimi K3 maksaa 0,86 dollaria yhdellä pisteellä enemmän, GLM-5.2 0,57 dollaria. Edeltäjäänsä verrattuna Qwen3.8 Max menettää myös pisteitä AA-LCR:ssä (-2 pistettä) ja AA-Omniscience-arvioinnissa (-10 pistettä). Sen osumatarkkuus pysyy noin 31 prosentissa, mutta hallusinaatioaste nousee 23 prosentista 40 prosenttiin, mikä tarkoittaa, että Qwen3.8 Max arvaa useammin sen sijaan, että ohittaisi kysymyksen.
Lähde: The Decoder (DE) —
Alkuperäinen
