⚡ 速報
Anthropic、Claude Opus 5を発表:エージェンティックコーディングとコンピュータタスクを同一Opus価格で
Anthropic
Anthropicは新しいフラッグシップモデルClaude Opus 5をリリースしました。エージェント機能が向上し、価格は変更なし(トークンあたり5ドル/25ドル)、コンテキストウィンドウは100万トークンです。本モデルは、コーディング、サイバーセキュリティ、自律タスクのベンチマークで大幅な向上を示し、思考メカニズムの更新と安全ポリシーの改訂が行われています。
Anthropicは、フラッグシップOpusレベルのモデルとしてOpus 4.8に取って代わるClaude Opus 5をリリースしました。価格は据え置きで、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです。このモデルは、Claude Fable 5の知能に半額で迫り、現在Claude Maxのデフォルトモデルであり、Claude Proで最も強力なモデルとなっています。APIレベルでは、3つの重要な変更が行われました。思考がデフォルトで有効になり(努力パラメータで深さを制御)、思考を無効にする(タイプ: 無効に設定)と努力度xhighまたはmaxの場合は400エラーが返され、開発者はモデルがすでに自己チェックを行うため「最終チェックを有効にする」などのプロンプトを削除するよう推奨されています。モデルIDはclaude-opus-5で、コンテキストウィンドウは100万トークン(最大かつデフォルト)、最大出力は同期メッセージAPIで12万8000トークン、メッセージバッチAPIで最大30万トークンです。ベンチマークでは、モデルは大きな成長を示しました:FrontierBench v0.1で43.3%(Opus 4.8は18.7%)、SWE-bench Verifiedで96.0%、OSWorld 2.0で70.57%、Zapier AutomationBenchで26.0%。エージェント結果は最も強力で、モデルはIMO 2026の問題42問中42問を解決しました(金メダル)。高努力度のARC-AGI-3では30.16%(以前の記録の4倍)。マルチモーダルタスクでは、ツール(コンテナ、画像クロッピング)が「思考」よりもはるかに効果的で、Chartographyでツール使用時83.0%に対し、思考のみ29.6%。サイバーセキュリティでは、能力が副次的に向上し、ExploitBenchでモデルは10.14フラグと99の完全なエクスプロイトを獲得しました(Mythos 5は132)。Anthropicはソースコードの脆弱性探索に関する制限のみ緩和し、バイナリスキャン、ペネトレーションテスト、エクスプロイト生成は引き続きブロックされています。分類器はFable 5よりも約85%頻度が低くなります。英国AISIテストでは、モデルは「The Last Ones」タスクを10回中8回解決しました。RSPプログラムによると、モデルはCB-1の能力はあるが、CB-2はありません。プロンプトインジェクション耐性で顕著な結果:ブラウザ攻撃は保護なしで31.5%から3.70%に、自動モードで0%に減少しました。しかし、同社はOpus 4.8と比較して事実上の幻覚率がわずかに高いといった欠点も公表しています。
出典: MarkTechPost —
原文
