ModellerYapay Zeka Güvenliği 🇷🇺 29.07.2026 19:03

Claude Opus 5: Yapay Zeka Analizine Göre En Zeki Model – Puanların Arkasında Ne Var

AnthropicAnthropic OpenAIOpenAI
Anthropic, 24 Temmuz 2026'da Claude Opus 5'i piyasaya sürdü ve en üst düzey modeli Claude Fable 5'in zekasına yarı fiyatına yaklaştığını iddia etti. Artificial Analysis'ten bağımsız kıyaslama endeksi, Opus 5'i 61 puanla birinci sıraya koydu; bu, Fable 5'in bir puan ve GPT-5.6 Sol'un iki puan önünde. Ancak modelin yavaş ve ayrıntılı olduğu, maksimum efor ayarlarında aşırı düşünme riski taşıdığı belirtiliyor.
Anthropic, 24 Temmuz 2026'da Sonnet 5 ile sınırlı Fable/Mythos 5 arasında konumlanan Claude Opus 5'i tanıttı. Modelde 1 milyon token bağlam penceresi, 128 bin token çıktı ve varsayılan olarak etkin muhakeme ile düşük, orta, yüksek, ekstra, maksimum olmak üzere beş çaba seviyesi bulunuyor. Dahili kıyaslamalarda Opus 5, Frontier-Bench v0.1 (ajan kodlama) testinde %43,3 puan alırken Opus 4.8 %18,7, Fable 5 %33,7 puan aldı; ARC-AGI-3 (soyut muhakeme) testinde ise %30,2'ye karşılık GPT-5.6 Sol %7,8 puan aldı. Ancak bağımsız Artificial Analysis Intelligence Index, Opus 5'e (maksimum çaba) 61 puan vererek Fable 5'in (60) sadece bir puan, GPT-5.6 Sol'un (59) ise iki puan üzerinde yer almasını sağladı ve modeli dar bir farkla en zeki model ilan etti. Modelin belirgin şekilde yavaş ve ayrıntılı olduğu belirtiliyor: Maksimum çabada ilk token'a kadar geçen süre bir dakikayı aşarken, kıyaslama paketi için toplam token tüketimi ~100 milyon (medyan ~63 milyon) oldu. Kazanımlarına rağmen Opus 5, DeepSWE v1.1 ajan kodlama (%68,8'e karşı GPT-5.6 Sol %72,7), HealthBench Professional (%59,8'e karşı Mythos 5 %66,0) ve Legal Agent Benchmark (%11,7'ye karşı Fable 5 %13,3) testlerini kaybetti. Anthropic'in raporu, Opus 5'in görüntü olmadan bir plan verildiğinde görevi çözmek için ham piksel verilerinden kendi bilgisayarlı görü programını yazdığı, rakiplerinin ise başarısız olduğu bir vakayı vurguluyor. Olumsuz tarafta ise, 10 bin dolar bütçe ve 24 saatle yapılan bir protein tasarımı testinde Opus 5 bir çalıştırmada hiçbir şey üretmezken diğerinde yalnızca 17 sıralanmamış varyant sundu ve verimsiz kendi kendini doğrulama döngülerinin kurbanı oldu. Şirket, maksimum çabanın aşırı düşünmeye yol açabileceği konusunda uyarıyor ve kodlama için ekstra, diğer görevler için yüksek seviyesinden başlanmasını öneriyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler