Qwen3.8 Max: Alibaba का सबसे मजबूत मॉडल अधिक बार अनुमान लगाता है और प्रति कार्य अधिक खर्च करता है
Alibaba/Qwen
Anthropic
Moonshot AI
Alibaba का Qwen3.8 Max आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में 56 अंक प्राप्त करता है, जो Qwen3.7 Max से 10 अधिक है, और यह Claude Opus 4.8 के बराबर है। हालांकि, यह प्रति कार्य अधिक महंगा है ($1.14 बनाम $0.53) और AA-Omniscience परीक्षण पर उच्च भ्रम दर (40% बनाम 23%) दिखाता है।
अलीबाबा का Qwen3.8 Max आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में 56 अंक प्राप्त करता है, जो Qwen3.7 Max (46) से 10 अंक अधिक है। आर्टिफिशियल एनालिसिस के अनुसार, यह Claude Opus 4.8 के बराबर है, GLM-5.2 (51) से आगे है, लेकिन Kimi K3 (57) से पीछे है, जो 25% सस्ता भी है। GDPval-AA वर्क-बेंचमार्क में, Qwen 468 Elo अंकों की छलांग लगाकर 1739 पर पहुंच जाता है, जो Kimi K3 (1685) से आगे है, केवल Claude Opus 5 (1852) बेहतर है। Qwen3.8 Max को प्रति कार्य 14 के बजाय 64 कार्यशील चरणों की आवश्यकता होती है, और इनपुट टोकन 15 गुना बढ़ जाते हैं क्योंकि परीक्षण प्रत्येक चरण पर पूरी बातचीत का इतिहास फिर से भेजता है। मॉडल अधिक गहन है लेकिन धीमा और महंगा है। हालांकि टोकन की कीमतें गिर गई हैं (इनपुट $2 बनाम $2.50, आउटपुट $6 बनाम $7.50, कैश-हिट $0.25 बनाम $0.50 प्रति मिलियन), इंटेलिजेंस इंडेक्स में एक कार्य की लागत $1.14 है, जो Qwen3.7 Max के $0.53 से दोगुने से अधिक है। Kimi K3 की लागत $0.86 है जिसमें एक अंक अधिक है, GLM-5.2 की $0.57 है। अपने पूर्ववर्ती की तुलना में, Qwen3.8 Max AA-LCR (-2 अंक) और AA-Omniscience (-10 अंक) में भी गिरावट दर्ज करता है। इसकी हिट दर लगभग 31% पर बनी हुई है, लेकिन भ्रम दर 23% से बढ़कर 40% हो जाती है, जिसका अर्थ है कि Qwen3.8 Max पास करने के बजाय अधिक बार अनुमान लगाता है।
स्रोत: The Decoder (DE) —
मूल
