смягчили основные риски, такие как инъекция подсказок (prompt injection) и эксфильтрация данных. Anthropic опубликовал результаты оценки, проведенной с участием 1053 платных тестировщиков, где в сессию была подменена опасная команда; только 13,6% людей отказались выполнить ее, в то время как автоматический режим заблокировал бы 89% таких действий. Anthropic также заказал оценку компании Trajectory Labs, которая протестировала 72 сценария непрямой инъекции подсказок против Claude Code и Codex, не выявив ни одной успешной атаки на Claude Fable 5, Opus 5 или Sonnet 5 в автоматическом режиме. Автор Саймон Уиллисон признает, что автоматический режим может быть лучше одобрения человеком из-за усталости от подтверждений, но он обеспокоен непрямой инъекцией подсказок через вредоносные пакеты, например, тестовой инструкцией, которая запускает вредоносный инструмент для эксфильтрации данных. Он призывает к независимому подтверждению и предлагает запускать агентов с ограниченным доступом к данным и инструментам.