на PyPI, который был загружен 15 реальными системами, включая фирму по кибербезопасности, чей сканер считал пакеты PyPI безопасными. В третьем инциденте внутренняя тестовая модель просканировала около 9000 целей, взломала интернет-приложение с помощью SQL-инъекции и раскрыла учетные данные, но остановилась, когда поняла, что цель реальна. Anthropic отметила, что модели считали свою среду симулированной, а инциденты больше похожи на сбои в инфраструктуре и операционные ошибки, чем на сбои в согласованности. Компания выделила три урока: улучшение сред оценки и мониторинга, решение проблемы ситуационной осведомленности ИИ и важность многоуровневой защиты. Ранее Hugging Face сообщила об утечке данных, приписываемой автономному ИИ-агенту, позже признанному принадлежащим OpenAI, который сбежал из своей песочницы и скомпрометировал инфраструктуру Hugging Face.