⚡ BREAKING
मॉडलएजेंट 🇺🇸 26.07.2026 16:05

Anthropic ने क्लॉड ओपस 5 लॉन्च किया: एजेंटिक कोडिंग और कंप्यूटर कार्य उसी कीमत पर

AnthropicAnthropic
Anthropic ने क्लॉड ओपस 5 जारी किया है, जो बेहतर एजेंटिक क्षमताओं वाला एक नया फ्लैगशिप मॉडल है। इसकी कीमत अपरिवर्तित (5/25 डॉलर प्रति मिलियन टोकन) है और इसमें 1 मिलियन टोकन का संदर्भ विंडो है। यह मॉडल कोडिंग, साइबर सुरक्षा और स्वायत्त कार्य बेंचमार्क में महत्वपूर्ण सुधार दिखाता है, साथ ही अद्यतन सोच तंत्र और संशोधित सुरक्षा नीतियां भी शामिल हैं।
Anthropic ने Claude Opus 5 जारी किया है, जो Opus 4.8 की जगह फ्लैगशिप Opus-स्तरीय मॉडल के रूप में आया है। कीमतें समान हैं: $5 प्रति मिलियन इनपुट टोकन और $25 प्रति मिलियन आउटपुट टोकन। यह मॉडल आधी कीमत पर Claude Fable 5 की बुद्धिमत्ता के करीब पहुंचता है और अब Claude Max पर डिफ़ॉल्ट मॉडल है तथा Claude Pro पर सबसे शक्तिशाली है। API स्तर पर तीन प्रमुख बदलाव हुए हैं: सोच (thinking) डिफ़ॉल्ट रूप से सक्षम है (effort पैरामीटर गहराई को नियंत्रित करता है); सोच को अक्षम करना (type: disabled सेट करना) जब effort xhigh या max हो, तो अब 400 त्रुटि लौटाता है; डेवलपर्स को सलाह दी जाती है कि वे "enable final check" जैसे प्रॉम्प्ट हटा दें क्योंकि मॉडल पहले से ही स्वयं-जांच करता है। मॉडल आईडी claude-opus-5 है, संदर्भ विंडो 1 मिलियन टोकन (अधिकतम और डिफ़ॉल्ट) है, अधिकतम आउटपुट सिंक्रोनस Messages API के माध्यम से 128k टोकन और Message Batches API के माध्यम से 300k टोकन तक है। बेंचमार्क में मॉडल ने महत्वपूर्ण वृद्धि दिखाई: FrontierBench v0.1 पर — 43.3% (Opus 4.8 — 18.7%), SWE-bench Verified पर — 96.0%, OSWorld 2.0 — 70.57%, Zapier AutomationBench — 26.0%। एजेंटिक परिणाम सबसे मजबूत हैं: मॉडल ने IMO 2026 के 42 में से 42 समस्याएं हल कीं (स्वर्ण पदक)। ARC-AGI-3 पर उच्च प्रयास के साथ — 30.16% (पिछले रिकॉर्ड से 4 गुना बेहतर)। मल्टीमॉडल कार्यों में, उपकरण (कंटेनर, इमेज क्रॉपिंग) "सोच" की तुलना में काफी अधिक प्रभावी हैं: Chartography पर उपकरणों के साथ — 83.0% बनाम 29.6%। साइबर सुरक्षा में, क्षमताएं एक दुष्प्रभाव के रूप में बढ़ीं: ExploitBench पर मॉडल को 10.14 फ्लैग और 99 पूर्ण एक्सप्लॉइट मिले (Mythos 5 — 132)। Anthropic ने केवल स्रोत कोड कमजोरियों की खोज पर प्रतिबंधों में ढील दी है; बाइनरी स्कैनिंग, पेनेट्रेशन टेस्टिंग, और एक्सप्लॉइट जनरेशन अवरुद्ध रहते हैं। क्लासिफायर Fable 5 की तुलना में लगभग 85% कम बार ट्रिगर होंगे। UK AISI परीक्षणों पर, मॉडल ने 10 में से 8 प्रयासों में "द लास्ट वन्स" कार्य हल किया। RSP कार्यक्रम के अनुसार, मॉडल में CB-1 क्षमताएं हैं, लेकिन CB-2 नहीं। प्रॉम्प्ट इंजेक्शन प्रतिरोध में उत्कृष्ट परिणाम: ब्राउज़र हमले बिना सुरक्षा के 31.5% से घटकर 3.70% और स्वचालित मोड के साथ 0% हो गए। हालांकि, कंपनी कमियां भी प्रकाशित करती है, जिसमें Opus 4.8 की तुलना में तथ्यात्मक मतिभ्रम की थोड़ी अधिक दर शामिल है।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार