сканирования уязвимостей, усиленный языковой моделью, который обнаружил ранее неизвестную уязвимость SQL-инъекции в широко используемом веб-приложении и автономно создал эксплойт. Третий сценарий оценивал способность ИИ-системы планировать и выполнять многоэтапную атаку с использованием программ-вымогателей, включая разведку сети, повышение привилегий и хищение данных. Оценки Anthropic показывают, что современные ИИ-модели могут воспроизводить известные шаблоны атак, но им не хватает ситуационной осведомлённости и адаптивности, присущих хакерам-людям. Компания рекомендует внедрять строгий контроль доступа, мониторинг выходных данных на предмет вредоносного поведения и разрабатывать надёжные протоколы тестирования с участием «красных команд» для снижения рисков.