⚡ SON DAKİKA
Anthropic, Claude Opus 5'i Tanıttı: Aynı Opus Fiyatıyla Aracılı Kodlama ve Bilgisayar Görevleri
Anthropic
Anthropic, gelişmiş aracılı yeteneklere sahip yeni amiral gemisi modeli Claude Opus 5'i piyasaya sürdü. Fiyatlandırma değişmedi (milyon token başına 5$/25$), 1 milyon token bağlam penceresi sunuyor. Model, kodlama, siber güvenlik ve otonom görev kriterlerinde önemli kazanımlar gösteriyor; güncellenmiş bir düşünme mekanizması ve revize edilmiş güvenlik politikaları içeriyor.
Anthropic, Opus 4.8'in yerini alan amiral gemisi Opus seviyesindeki modeli Claude Opus 5'i yayınladı. Fiyatlar aynı kaldı: milyon giriş token'ı başına 5 dolar ve milyon çıkış token'ı başına 25 dolar. Model, Claude Fable 5'e yarı fiyatına yakın bir zeka sunuyor ve artık Claude Max'te varsayılan model, Claude Pro'da ise en güçlü model. API düzeyinde üç önemli değişiklik oldu: düşünme varsayılan olarak etkinleştirildi (çaba parametresi derinliği kontrol ediyor); düşünmeyi devre dışı bırakma (tür: devre dışı) xhigh veya max çabasıyla ayarlandığında artık 400 hatası döndürüyor; geliştiricilere 'son kontrolü etkinleştir' gibi istemleri kaldırmaları öneriliyor çünkü model zaten kendi kendini kontrol ediyor. Model kimliği claude-opus-5, bağlam penceresi 1M token (maksimum ve varsayılan), maksimum çıktı senkron Messages API ile 128k token ve Message Batches API ile 300k token'a kadar. Kıyaslamalarda model önemli bir büyüme gösterdi: FrontierBench v0.1'de — %43.3 (Opus 4.8 — %18.7), SWE-bench Verified'da — %96.0, OSWorld 2.0'da — %70.57, Zapier AutomationBench'te — %26.0. Aracı sonuçlar en güçlüsü: model IMO 2026'nın 42 sorusunun 42'sini çözdü (altın madalya). Yüksek çaba ile ARC-AGI-3'te — %30.16 (önceki rekorun 4 katı). Çok modlu görevlerde araçlar (konteynerler, görüntü kırpma) 'düşünme'den önemli ölçüde daha etkili: Chartography'de araçlarla — %83.0'a karşılık %29.6. Siber güvenlikte yetenekler yan etki olarak arttı: ExploitBench'te model 10.14 bayrak ve 99 tam istismar elde etti (Mythos 5 — 132). Anthropic yalnızca kaynak kod güvenlik açığı avcılığı üzerindeki kısıtlamaları gevşetti; ikili tarama, sızma testi ve istismar üretimi engellenmeye devam ediyor. Sınıflandırıcılar, Fable 5'e kıyasla yaklaşık %85 daha az tetiklenecek. UK AISI testlerinde model, 'The Last Ones' görevini 10 denemeden 8'inde çözdü. RSP programına göre model CB-1 yeteneklerine sahip, ancak CB-2'ye değil. İstem enjeksiyonuna karşı dirençte olağanüstü sonuç: tarayıcı saldırıları koruma olmadan %31.5'ten %3.70'e, otomatik modla %0'a düştü. Ancak şirket ayrıca, Opus 4.8'e kıyasla biraz daha yüksek gerçeklik yanılsaması oranı da dahil olmak üzere dezavantajları da yayınlıyor.
Kaynak: MarkTechPost —
orijinal
