⚡ BREAKING
ModelAgen 🇺🇸 26.07.2026 16:05

Anthropic Luncurkan Claude Opus 5: Tugas Coding dan Komputer Agen pada Harga Opus yang Sama

AnthropicAnthropic
Anthropic telah merilis Claude Opus 5, model flagship baru dengan kemampuan agen yang ditingkatkan, harga yang tidak berubah ($5/$25 per juta token), dan jendela konteks 1 juta token. Model ini menunjukkan peningkatan signifikan dalam tolok ukur coding, keamanan siber, dan tugas otonom, dengan mekanisme berpikir yang diperbarui serta kebijakan keamanan yang direvisi.
Anthropic telah merilis Claude Opus 5, menggantikan Opus 4.8 sebagai model unggulan tingkat Opus. Harga tetap sama: $5 per juta token input dan $25 per juta token output. Model ini mendekati kecerdasan Claude Fable 5 dengan harga setengahnya dan kini menjadi model default di Claude Max serta yang terkuat di Claude Pro. Pada level API, terjadi tiga perubahan penting: berpikir diaktifkan secara default (parameter effort mengontrol kedalaman); menonaktifkan berpikir (menyetel type: disabled) dengan effort xhigh atau max kini mengembalikan error 400; pengembang disarankan untuk menghapus prompt seperti "aktifkan pemeriksaan akhir" karena model sudah memeriksa sendiri. ID model adalah claude-opus-5, jendela konteks 1M token (maksimum dan default), output maksimum 128k token melalui API Messages sinkron dan hingga 300k melalui API Message Batches. Dalam benchmark, model menunjukkan pertumbuhan signifikan: di FrontierBench v0.1 — 43.3% (Opus 4.8 — 18.7%), di SWE-bench Verified — 96.0%, OSWorld 2.0 — 70.57%, Zapier AutomationBench — 26.0%. Hasil agen paling kuat: model menyelesaikan 42 dari 42 soal IMO 2026 (medali emas). Pada ARC-AGI-3 dengan effort tinggi — 30.16% (4 kali lebih baik dari rekor sebelumnya). Dalam tugas multimodal, alat (container, pemotongan gambar) secara signifikan lebih efektif daripada "berpikir": pada Chartography dengan alat — 83.0% vs. 29.6%. Dalam keamanan siber, kemampuan meningkat sebagai efek samping: pada ExploitBench model mendapatkan 10.14 flag dan 99 exploit lengkap (Mythos 5 — 132). Anthropic hanya melonggarkan pembatasan pada perburuan kerentanan kode sumber; pemindaian biner, pengujian penetrasi, dan pembuatan exploit tetap diblokir. Klasifikasi akan memicu sekitar 85% lebih jarang daripada pada Fable 5. Pada tes UK AISI, model menyelesaikan tugas "The Last Ones" dalam 8 dari 10 percobaan. Menurut program RSP, model memiliki kemampuan CB-1, tetapi tidak CB-2. Hasil luar biasa dalam resistensi injeksi prompt: serangan browser turun dari 31.5% menjadi 3.70% tanpa perlindungan dan menjadi 0% dengan mode otomatis. Namun, perusahaan juga mempublikasikan kekurangan, termasuk tingkat halusinasi faktual yang sedikit lebih tinggi dibandingkan Opus 4.8.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru