Qwen3.8 Max:阿里最强模型更常在猜测且单位任务成本更高
Alibaba/Qwen
Anthropic
Moonshot AI
阿里巴巴的Qwen3.8 Max在人工智能分析智能指数中取得56分,比Qwen3.7 Max高出10分,与Claude Opus 4.8持平。然而,它在单位任务上的成本更高(1.14美元对0.53美元),且在AA-Omniscience测试中幻觉率上升(40%对23%)。
阿里巴巴的Qwen3.8 Max在人工智能分析智能指数中得分为56,比Qwen3.7 Max(46分)高出10分。根据人工智能分析,它与Claude Opus 4.8持平,领先于GLM-5.2(51分),但落后于Kimi K3(57分),后者运营成本还低25%。在GDPval-AA工作基准测试中,Qwen的评分跃升468 Elo至1739,超过了Kimi K3(1685),仅Claude Opus 5(1852)表现更佳。Qwen3.8 Max每个任务需要64个而非14个工作步骤,输入令牌增加了15倍,因为测试在每一步都会重新发送整个对话历史。该模型更彻底,但更慢且成本更高。尽管令牌价格下降(输入每百万$2 vs $2.50,输出$6 vs $7.50,缓存命中$0.25 vs $0.50),但智能指数中的一个任务成本为$1.14,是Qwen3.7 Max的$0.53的两倍多。Kimi K3成本$0.86且得分多一分,GLM-5.2成本$0.57。与前代产品相比,Qwen3.8 Max在AA-LCR(-2分)和AA-Omniscience(-10分)上也有所退步。其命中率保持在31%左右,但幻觉率从23%上升至40%,这意味着Qwen3.8 Max更频繁地猜测而不是跳过。
来源: The Decoder (DE) —
原文
