изменения: мышление включено по умолчанию (параметр effort контролирует глубину); отключение мышления (установка type: disabled) с effort xhigh или max теперь возвращает ошибку 400; разработчикам рекомендуется удалить такие подсказки, как «enable final check», поскольку модель уже сама выполняет самопроверку. Идентификатор модели — claude-opus-5, контекстное окно — 1 миллион токенов (максимум и по умолчанию), максимальный вывод — 128 тысяч токенов через синхронный Messages API и до 300 тысяч через Message Batches API. В бенчмарках модель показала значительный рост: на FrontierBench v0.1 — 43,3% (Opus 4.8 — 18,7%), на SWE-bench Verified — 96,0%, OSWorld 2.0 — 70,57%, Zapier AutomationBench — 26,0%. Агентные результаты самые сильные: модель решила 42 из 42 задач IMO 2026 (золотая медаль). На ARC-AGI-3 с высоким усилием — 30,16% (в 4 раза лучше предыдущего рекорда). В мультимодальных задачах инструменты (контейнеры, обрезка изображений) значительно эффективнее, чем «мышление»: на Chartography с инструментами — 83,0% против 29,6%. В кибербезопасности возможности возросли как побочный эффект: на ExploitBench модель получила 10,14 флагов и 99 полных эксплойтов (Mythos 5 — 132). Anthropic только ослабила ограничения на поиск уязвимостей в исходном коде; сканирование бинарных файлов, тестирование на проникновение и генерация эксплойтов остаются заблокированными. Классификаторы будут срабатывать примерно на 85% реже, чем на Fable 5. На тестах UK AISI модель решила задачу «The Last Ones» в 8 из 10 попыток. Согласно программе RSP, модель обладает возможностями уровня CB-1, но не CB-2. Выдающийся результат в устойчивости к инъекциям подсказок: атаки через браузер снизились с 31,5% до 3,70% без защиты и до 0% в автоматическом режиме. Однако компания также публикует недостатки,
Показать ещё ↓