Claude Opus 5: Model Terpintar Menurut Artificial Analysis – Apa di Balik Skor-Skor Tersebut
Anthropic
OpenAI
Anthropic merilis Claude Opus 5 pada 24 Juli 2026, mengklaim bahwa model ini mendekati kecerdasan Claude Fable 5 andalan mereka dengan setengah harga. Indeks tolok ukur independen dari Artificial Analysis menempatkan Opus 5 di urutan pertama (61 poin), unggul satu poin dari Fable 5 dan dua poin dari GPT-5.6 Sol. Namun, model ini dinilai lambat dan bertele-tele, dengan risiko berpikir berlebihan pada pengaturan usaha maksimal.
Anthropic meluncurkan Claude Opus 5 pada 24 Juli 2026, diposisikan di antara Sonnet 5 dan Fable/Mythos 5 yang terbatas. Model ini memiliki jendela konteks 1 juta token, output 128 ribu token, dan penalaran yang diaktifkan secara default dengan lima tingkat upaya: rendah, sedang, tinggi, ekstra, maksimal. Pada tolok ukur internal, Opus 5 mencetak 43,3% di Frontier-Bench v0.1 (pengkodean agen) versus 18,7% untuk Opus 4.8 dan 33,7% untuk Fable 5; pada ARC-AGI-3 (penalaran abstrak) mencapai 30,2% dibandingkan dengan 7,8% dari GPT-5.6 Sol. Namun, Indeks Kecerdasan Analisis Buatan Independen (Artificial Analysis Intelligence Index) memberikan Opus 5 skor 61 (upaya maksimal), hanya satu poin di atas Fable 5 (60) dan dua di atas GPT-5.6 Sol (59), menyatakannya sebagai model terpintar dengan selisih tipis. Model ini digambarkan sangat lambat dan bertele-tele: waktu hingga token pertama pada upaya maksimal melebihi satu menit, dan konsumsi total token untuk rangkaian tolok ukur adalah ~100 juta berbanding median ~63 juta. Meskipun unggul, Opus 5 kalah dalam pengkodean agen DeepSWE v1.1 (68,8% berbanding 72,7% GPT-5.6 Sol), HealthBench Professional (59,8% berbanding 66,0% Mythos 5), dan Tolok Ukur Agen Hukum (Legal Agent Benchmark) (11,7% berbanding 13,3% Fable 5). Laporan Anthropic menyoroti kasus di mana Opus 5, yang diberi cetak biru tanpa visi, menulis program visi komputernya sendiri dari data piksel mentah untuk menyelesaikan tugas, sementara pesaingnya gagal. Di sisi negatif, dalam tes desain protein dengan anggaran $10.000 dan waktu 24 jam, Opus 5 tidak memberikan apa pun dalam satu kali proses dan hanya 17 varian yang tidak diperingkat dalam proses lainnya, menjadi korban perulangan verifikasi diri yang tidak produktif. Perusahaan memperingatkan bahwa upaya maksimal mungkin menderita karena berpikir berlebihan, dan merekomendasikan untuk memulai pada level ekstra untuk pengkodean dan tinggi untuk tugas lainnya.
Sumber: Habr — хаб ИИ —
asli
