является ли действие опасным или необратимым, и запрашивает подтверждение только при необходимости. По словам Anthropic, тесты с участием 1053 платных тестировщиков и внутренние испытания показали, что автоматический режим по меньшей мере так же безопасен или даже безопаснее, чем ручные подтверждения, а команды, использующие автоматический режим, создают примерно на 25% больше запросов на включение изменений. Anthropic также подчёркивает, что автоматический режим обеспечивает дополнительный уровень защиты от атак с внедрением промптов, когда внедрённый код пытается отвлечь агента от инструкций пользователя. Независимая проверка, проведённая Trajectory Labs, протестировала 72 подобных сценария атаки десять раз каждый, и ни одна из 720 атак не увенчалась успехом против текущих моделей Claude (Fable 5, Opus 5, Sonnet 5) в автоматическом режиме, в то время как 5,83% атак оказались успешными против OpenAI GPT-5.6 Sol в режиме автоматической проверки Codex. Внутренние тесты показали, что автоматический режим предотвратил загрузку конфиденциальных данных на публичную страницу и завершение около 2000 процессов в длительной сессии, что могло бы уничтожить выполняющиеся задания по обучению графических процессоров. Anthropic не взимает плату за токены, потребляемые самим классификатором, но автоматический режим по умолчанию, вероятно, экономически выгоден для компании, поскольку увеличивает общее потребление токенов и доход. Claude Code в настоящее время является наиболее широко используемым ИИ-инструментом для программирования, и этот сдвиг перемещает роль разработчика с активного написания кода на мониторинг сгенерированного ИИ вывода. Anthropic советует проявлять осторожность с производственной критической инфраструктурой, отмечая, что классификатор снижает, но не устраняет

Показать ещё ↓