Qwen3.8 Max: Alibaba का सबसे मजबूत मॉडल अधिक बार अनुमान लगाता है और प्रति कार्य अधिक खर्च करता है

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
Alibaba का Qwen3.8 Max आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में 56 अंक प्राप्त करता है, जो Qwen3.7 Max से 10 अधिक है, और यह Claude Opus 4.8 के बराबर है। हालांकि, यह प्रति कार्य अधिक महंगा है ($1.14 बनाम $0.53) और AA-Omniscience परीक्षण पर उच्च भ्रम दर (40% बनाम 23%) दिखाता है।
अलीबाबा का Qwen3.8 Max आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स में 56 अंक प्राप्त करता है, जो Qwen3.7 Max (46) से 10 अंक अधिक है। आर्टिफिशियल एनालिसिस के अनुसार, यह Claude Opus 4.8 के बराबर है, GLM-5.2 (51) से आगे है, लेकिन Kimi K3 (57) से पीछे है, जो 25% सस्ता भी है। GDPval-AA वर्क-बेंचमार्क में, Qwen 468 Elo अंकों की छलांग लगाकर 1739 पर पहुंच जाता है, जो Kimi K3 (1685) से आगे है, केवल Claude Opus 5 (1852) बेहतर है। Qwen3.8 Max को प्रति कार्य 14 के बजाय 64 कार्यशील चरणों की आवश्यकता होती है, और इनपुट टोकन 15 गुना बढ़ जाते हैं क्योंकि परीक्षण प्रत्येक चरण पर पूरी बातचीत का इतिहास फिर से भेजता है। मॉडल अधिक गहन है लेकिन धीमा और महंगा है। हालांकि टोकन की कीमतें गिर गई हैं (इनपुट $2 बनाम $2.50, आउटपुट $6 बनाम $7.50, कैश-हिट $0.25 बनाम $0.50 प्रति मिलियन), इंटेलिजेंस इंडेक्स में एक कार्य की लागत $1.14 है, जो Qwen3.7 Max के $0.53 से दोगुने से अधिक है। Kimi K3 की लागत $0.86 है जिसमें एक अंक अधिक है, GLM-5.2 की $0.57 है। अपने पूर्ववर्ती की तुलना में, Qwen3.8 Max AA-LCR (-2 अंक) और AA-Omniscience (-10 अंक) में भी गिरावट दर्ज करता है। इसकी हिट दर लगभग 31% पर बनी हुई है, लेकिन भ्रम दर 23% से बढ़कर 40% हो जाती है, जिसका अर्थ है कि Qwen3.8 Max पास करने के बजाय अधिक बार अनुमान लगाता है।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार