Frontier-Bench v0.1 (агентное программирование) против 18,7% у Opus 4.8 и 33,7% у Fable 5; на ARC-AGI-3 (абстрактное мышление) модель достигает 30,2% по сравнению с 7,8% у GPT-5.6 Sol. Однако независимый индекс Artificial Analysis Intelligence Index оценивает Opus 5 в 61 балл (при максимальных усилиях), что всего на один балл выше Fable 5 (60) и на два выше GPT-5.6 Sol (59), признавая её самой умной моделью с небольшим отрывом. Модель описывается как заметно медленная и многословная: время до первого токена при максимальных усилиях превышает минуту, а общее потребление токенов для набора эталонных тестов составило около 100 миллионов против медианных 63 миллионов. Несмотря на победы, Opus 5 уступает на DeepSWE v1.1 в агентном программировании (68,8% против 72,7% у GPT-5.6 Sol), HealthBench Professional (59,8% против 66,0% у Mythos 5) и Legal Agent Benchmark (11,7% против 13,3% у Fable 5). В отчёте Anthropic описан случай, когда Opus 5, получив чертёж без визуальной информации, самостоятельно написал программу компьютерного зрения для обработки необработанных пиксельных данных, чтобы решить задачу, в то время как конкуренты потерпели неудачу. С негативной стороны, в тесте на проектирование белков с бюджетом в 10 000 долларов США и временем 24 часа Opus 5 не выдал ничего в одном запуске и только 17 неранжированных вариантов в другом, попав в ловушку непродуктивных циклов самопроверки. Компания предупреждает, что максимальные усилия могут страдать от излишнего обдумывания, и рекомендует начинать с дополнительного уровня для программирования и высокого — для остальных задач.