モデルAI安全性 🇷🇺 29.07.2026 19:03

Claude Opus 5:Artificial Analysisが最高評価、スコアの内訳

AnthropicAnthropic OpenAIOpenAI
Anthropicは2026年7月24日にClaude Opus 5をリリースし、最上位モデルのClaude Fable 5に近い知能を半額で提供すると主張しています。Artificial Analysisの独立したベンチマーク指標ではOpus 5が1位(61ポイント)で、Fable 5を1ポイント、GPT-5.6 Solを2ポイント上回りました。ただし、このモデルは遅く冗長で、最大努力設定では考えすぎるリスクがあると指摘されています。
Anthropicは2026年7月24日、Claude Opus 5を発表した。Sonnet 5と制限付きのFable/Mythos 5の中間に位置づけられる。1Mトークンのコンテキストウィンドウ、128Kの出力を備え、推論機能がデフォルトで有効化されており、5段階の努力レベル(低、中、高、追加、最大)が用意されている。内部ベンチマークでは、Frontier-Bench v0.1(エージェント型コーディング)でOpus 5は43.3%を記録し、Opus 4.8の18.7%、Fable 5の33.7%を上回った。ARC-AGI-3(抽象推論)では30.2%で、GPT-5.6 Solの7.8%を大きく引き離した。しかし、独立系のArtificial Analysis Intelligence Indexでは、Opus 5は最大努力でスコア61となり、Fable 5(60)をわずか1ポイント、GPT-5.6 Sol(59)を2ポイント上回るに留まり、僅差で最も賢いモデルと宣言された。このモデルは著しく遅く、冗長であると説明されている。最大努力時の最初のトークンまでの時間は1分を超え、ベンチマークスイート全体のトークン消費量は約1億トークンで、中央値の約6300万トークンを上回った。勝利は収めたものの、Opus 5はDeepSWE v1.1のエージェント型コーディング(68.8%対GPT-5.6 Solの72.7%)、HealthBench Professional(59.8%対Mythos 5の66.0%)、Legal Agent Benchmark(11.7%対Fable 5の13.3%)では敗北している。Anthropicのレポートでは、Opus 5がビジョンモジュールなしで設計図を与えられた場合、生のピクセルデータから独自のコンピュータビジョンプログラムを書いてタスクを解決した一方、競合他社は失敗した事例が紹介されている。否定的な面として、1万ドルの予算と24時間のタンパク質設計テストでは、Opus 5は1回の実行で何も出力せず、別の実行では17個の無ランクのバリアントのみを生成し、非生産的な自己検証ループに陥った。同社は最大努力レベルでは考えすぎ(overthinking)の問題が生じる可能性があると警告し、コーディングには「追加」レベル、その他のタスクには「高」レベルから始めることを推奨している。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース