Классификатор был протестирован в состязательном режиме совместно с Apollo Research, которая внедряла синтетические атаки в реальные трассы кодирования; после доработки auto mode смог распознать примерно половину ранее пропущенных атак, при этом доля пропущенных атак снизилась с 12% до 7% на объединённых наборах данных. В тестах на prompt injection, проведённых Trajectory Labs, модели Claude Fable 5, Opus 5 и Sonnet 5, работающие в режиме auto mode, не были скомпрометированы ни разу за 720 попыток, тогда как GPT-5.6 Sol в режиме Codex Auto-review показала долю успешных атак 5,83%, а в режиме Full Access — 19,03%. Среди трёх публичных случаев перехвата — блокировка попытки опубликовать отчёт на публичном сервисе для обмена кодом, блокировка массового завершения процессов в 2000 подах и выявление облачной роли с полными правами администратора. Среди новых возможностей — жёсткий запрет на утечку данных, разграничение доступа к ключам и конфиденциальной информации, проверка статуса git перед выполнением таких команд, как git reset --hard, а также проверка на стороне API (программного интерфейса приложения) на попытки prompt injection. Пользователи могут переключать режимы с помощью сочетания клавиш Shift+Tab в интерфейсе командной строки (CLI) или через выпадающее меню режимов в десктопном приложении; администраторы могут задавать настройки по умолчанию для всей организации или полностью отключать auto mode. Anthropic отмечает, что auto mode снижает, но не устраняет риски, и рекомендует вручную проверять изменения с высоким уровнем риска.