मॉडलAI सुरक्षा 🇷🇺 29.07.2026 19:03

Claude Opus 5: आर्टिफिशियल एनालिसिस के अनुसार सबसे स्मार्ट मॉडल – स्कोर के पीछे क्या है

AnthropicAnthropic OpenAIOpenAI
Anthropic ने 24 जुलाई 2026 को Claude Opus 5 जारी किया, जो अपने शीर्ष-स्तरीय Claude Fable 5 की बुद्धिमत्ता के करीब होने का दावा करता है, लेकिन आधी कीमत पर। आर्टिफिशियल एनालिसिस के स्वतंत्र बेंचमार्क इंडेक्स में Opus 5 पहले स्थान पर (61 अंक) है, जो Fable 5 से एक अंक और GPT-5.6 Sol से दो अंक आगे है। हालांकि, मॉडल धीमा और वर्बोज़ बताया गया है, जिसमें अधिकतम प्रयास सेटिंग्स पर ओवरथिंकिंग का जोखिम है।
Anthropic ने 24 जुलाई 2026 को Claude Opus 5 का अनावरण किया, जो Sonnet 5 और प्रतिबंधित Fable/Mythos 5 के बीच स्थित है। इसमें 1 मिलियन टोकन का कॉन्टेक्स्ट विंडो, 128K आउटपुट है, और रीज़निंग डिफ़ॉल्ट रूप से सक्षम है जिसमें पाँच प्रयास स्तर हैं: low, medium, high, extra और max। आंतरिक बेंचमार्क पर, Opus 5 Frontier-Bench v0.1 (एजेंटिक कोडिंग) में 43.3% स्कोर करता है, जबकि Opus 4.8 का 18.7% और Fable 5 का 33.7% है; ARC-AGI-3 (अमूर्त तर्क) में यह 30.2% प्राप्त करता है, जबकि GPT-5.6 Sol का 7.8% है। हालांकि, स्वतंत्र Artificial Analysis Intelligence Index Opus 5 को 61 का स्कोर (max effort पर) देता है, जो Fable 5 (60) से सिर्फ एक अंक और GPT-5.6 Sol (59) से दो अंक अधिक है, और इसे मामूली अंतर से सबसे स्मार्ट मॉडल घोषित करता है। मॉडल को काफी धीमा और शब्दाडंबरपूर्ण बताया गया है: max effort पर पहले टोकन का समय एक मिनट से अधिक है, और बेंचमार्क सूट के लिए कुल टोकन खपत ~100M बनाम ~63M मेडियन थी। जीत के बावजूद, Opus 5 DeepSWE v1.1 एजेंटिक कोडिंग (68.8% बनाम GPT-5.6 Sol का 72.7%), HealthBench Professional (59.8% बनाम Mythos 5 का 66.0%) और Legal Agent Benchmark (11.7% बनाम Fable 5 का 13.3%) में हार जाता है। Anthropic की रिपोर्ट एक मामले पर प्रकाश डालती है जहाँ Opus 5 ने बिना विज़न के एक ब्लूप्रिंट दिए जाने पर, कार्य को हल करने के लिए कच्चे पिक्सेल डेटा से अपना स्वयं का कंप्यूटर विज़न प्रोग्राम लिखा, जबकि प्रतिस्पर्धी विफल रहे। नकारात्मक पक्ष पर, $10K बजट और 24 घंटे के प्रोटीन डिज़ाइन परीक्षण में, Opus 5 ने एक रन में कुछ नहीं दिया और दूसरे में केवल 17 अश्रेणीबद्ध वेरिएंट दिए, जो अनुत्पादक स्व-सत्यापन लूप का शिकार हो गया। कंपनी चेतावनी देती है कि max effort में अति-सोच की समस्या हो सकती है, और कोडिंग के लिए extra और अन्य कार्यों के लिए high से शुरू करने की सिफारिश करती है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार