Qwen3.8 Max: Model Terkuat Alibaba Lebih Sering Menebak dan Biaya Lebih Tinggi per Tugas
Alibaba/Qwen
Anthropic
Moonshot AI
Qwen3.8 Max dari Alibaba mencapai 56 poin dalam Indeks Kecerdasan Artificial Analysis, 10 poin lebih tinggi daripada Qwen3.7 Max, menyamai Claude Opus 4.8. Namun, model ini lebih mahal per tugas ($1,14 dibanding $0,53) dan menunjukkan peningkatan tingkat halusinasi (40% dibanding 23%) pada tes AA-Omniscience.
Alibaba Qwen3.8 Max mencetak 56 poin pada Artificial Analysis Intelligence Index, 10 poin lebih banyak daripada Qwen3.7 Max (46). Menurut Artificial Analysis, skor ini setara dengan Claude Opus 4.8, lebih unggul dari GLM-5.2 (51), tetapi di belakang Kimi K3 (57) yang juga beroperasi 25% lebih murah. Dalam tolok ukur kerja GDPval-AA, Qwen melonjak 468 Elo menjadi 1739, melampaui Kimi K3 (1685), dan hanya Claude Opus 5 (1852) yang lebih baik. Qwen3.8 Max memerlukan 64 langkah kerja per tugas, bukan 14, dan token masukan meningkat 15 kali lipat karena pengujian mengirim ulang seluruh riwayat percakapan pada setiap langkah. Model ini lebih teliti tetapi lebih lambat dan lebih mahal. Meskipun harga token turun (masukan $2 vs $2,50, keluaran $6 vs $7,50, cache-hit $0,25 vs $0,50 per juta), satu tugas dalam Intelligence Index membutuhkan biaya $1,14, lebih dari dua kali lipat biaya Qwen3.7 Max sebesar $0,53. Kimi K3 membutuhkan biaya $0,86 dengan skor satu poin lebih tinggi, sedangkan GLM-5.2 sebesar $0,57. Dibandingkan pendahulunya, Qwen3.8 Max juga mengalami penurunan pada AA-LCR (-2 poin) dan AA-Omniscience (-10 poin). Tingkat keberhasilannya tetap sekitar 31%, tetapi tingkat halusinasi naik dari 23% menjadi 40%, yang berarti Qwen3.8 Max lebih sering menebak daripada menolak.
Sumber: The Decoder (DE) —
asli
