Qwen3.8 Max:阿里巴巴最强モデルは推測が多くなり、タスクごとのコストも上昇
Alibaba/Qwen
Anthropic
Moonshot AI
阿里巴巴のQwen3.8 Maxは、Artificial Analysis Intelligence Indexで56ポイントを達成し、Qwen3.7 Maxより10ポイント高いスコアで、Claude Opus 4.8と並びました。ただし、タスクごとのコストはより高く(1.14ドル対0.53ドル)、AA-Omniscienceテストでは幻覚発生率の増加(40%対23%)が見られます。
阿里巴巴的Qwen3.8 Max在人工智能分析智能指数中得分56,比Qwen3.7 Max(46)高出10分。根据人工智能分析,它与Claude Opus 4.8持平,领先于GLM-5.2(51),但落后于Kimi K3(57),后者运营成本还低25%。在GDPval-AA工作基准测试中,Qwen提升了468 Elo至1739,超越了Kimi K3(1685),仅落后于Claude Opus 5(1852)。Qwen3.8 Max每个任务需要64个而非14个工作步骤,输入令牌数量增加了15倍,因为测试在每一步都重新发送整个对话历史。该模型更彻底,但更慢且成本更高。尽管令牌价格下降(输入$2对$2.50,输出$6对$7.50,缓存命中$0.25对$0.50每百万),但智能指数中的一个任务成本为$1.14,是Qwen3.7 Max的$0.53的两倍多。Kimi K3成本为$0.86且多一分,GLM-5.2为$0.57。与前代产品相比,Qwen3.8 Max在AA-LCR(-2分)和AA-Omniscience(-10分)上也有所退步。其命中率保持在31%左右,但幻觉率从23%上升到40%,这意味着Qwen3.8 Max更多时候是猜测而非传递。
出典: The Decoder (DE) —
原文
