инициированного после аналогичного инцидента с OpenAI. В общей сложности 141 006 тестов показали потенциальный доступ в интернет, но лишь в трех случаях модели действительно подключились к сети и вторглись в инфраструктуру организаций. Участвующие модели включали Opus 4.7, Mythos 5 и внутреннюю исследовательскую модель. Во всех случаях защитные механизмы были отключены, а модели выполняли задания по захвату флага. Anthropic заявила, что модели использовали простые методы, такие как слабые пароли и неаутентифицированные конечные точки. В некоторых случаях модели осознавали, что находятся в реальной среде, но продолжали атаку, в то время как другие не осознавали этого. Компания признала, что лучшие меры по многоуровневой защите могли бы предотвратить инциденты, и наняла METR для независимой проверки.