⚡ عاجل
Anthropic تكشف عن Claude Opus 5: مهام برمجية وحاسوبية وكيلية بنفس سعر Opus
Anthropic
أطلقت Anthropic نموذج Claude Opus 5 الرائد الجديد مع قدرات وكيلية محسّنة، وأسعار غير متغيرة (5 دولارات/25 دولاراً لكل مليون رمز)، ونافذة سياقية تبلغ مليون رمز. يُظهر النموذج تحسناً ملحوظاً في معايير البرمجة والأمن السيبراني والمهام المستقلة، مع آلية تفكير محدثة وسياسات سلامة منقحة.
لقد أصدرت Anthropic نموذج Claude Opus 5، ليحل محل Opus 4.8 كالنموذج الرائد على مستوى Opus. وتبقى الأسعار كما هي: 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج. يقترب النموذج من Claude Fable 5 في الذكاء بنصف السعر، وهو الآن النموذج الافتراضي على Claude Max والأقوى على Claude Pro. على مستوى واجهة برمجة التطبيقات، حدثت ثلاثة تغييرات رئيسية: التفكير مفعّل افتراضيًا (تتحكم معلمة الجهد في العمق)؛ تعطيل التفكير (ضبط النوع على معطل) مع جهد عالٍ جدًا أو أقصى يُرجع الآن خطأ 400؛ يُنصح المطورون بإزالة التعليمات مثل "تمكين الفحص النهائي" حيث يقوم النموذج بالفعل بالفحص الذاتي. معرّف النموذج هو claude-opus-5، ونافذة السياق هي 1 مليون رمز (الحد الأقصى والافتراضي)، والحد الأقصى للإخراج هو 128 ألف رمز عبر واجهة برمجة تطبيقات الرسائل المتزامنة وحتى 300 ألف عبر واجهة برمجة تطبيقات دفعات الرسائل. في الاختبارات المعيارية، أظهر النموذج نموًا كبيرًا: في FrontierBench v0.1 — 43.3% (Opus 4.8 — 18.7%)، في SWE-bench Verified — 96.0%، OSWorld 2.0 — 70.57%، Zapier AutomationBench — 26.0%. النتائج الوكيلية هي الأقوى: حل النموذج 42 من أصل 42 مسألة في أولمبياد الرياضيات الدولي 2026 (ميدالية ذهبية). في ARC-AGI-3 بجهد عالٍ — 30.16% (أفضل بأربع مرات من الرقم القياسي السابق). في المهام متعددة الوسائط، تكون الأدوات (الحاويات، قص الصور) أكثر فعالية بكثير من "التفكير": في Chartography مع الأدوات — 83.0% مقابل 29.6%. في الأمن السيبراني، زادت القدرات كأثر جانبي: في ExploitBench حصل النموذج على 10.14 علامة و99 استغلالًا كاملًا (Mythos 5 — 132). خففت Anthropic القيود فقط على البحث عن ثغرات التعليمات البرمجية المصدرية؛ فحص الثنائيات، واختبار الاختراق، وتوليد الاستغلالات لا تزال محظورة. ستعمل المصنفات بشكل أقل بنحو 85% مقارنةً بـ Fable 5. في اختبارات UK AISI، حل النموذج مهمة "الآخرون الأخيرون" في 8 من أصل 10 محاولات. وفقًا لبرنامج RSP، يمتلك النموذج قدرات CB-1 ولكن ليس CB-2. نتيجة استثنائية في مقاومة حقن الأوامر: انخفضت هجمات المتصفح من 31.5% إلى 3.70% بدون حماية وإلى 0% مع الوضع التلقائي. ومع ذلك، تنشر الشركة أيضًا سلبيات، بما في ذلك معدل أعلى قليلاً من الهلوسة الواقعية مقارنةً بـ Opus 4.8.
المصدر: MarkTechPost —
الأصلي
