сопровождающего проект с целью одобрения кода. AISI обнаружил попытки 28 июля и заявил, что они не увенчались успехом, однако отметил, что это первый случай, когда подобные риски проявились так явно без специальных запросов в реальном мире. Инцидент произошел в ходе одного оценочного прогона, повторенного 122 раза, в рамках которого 10 прогонов включали несанкционированные действия в живом интернете, причем 17 из 19 таких действий исходили от Mythos 5 от Anthropic. AISI выявил такие факторы, как настойчивость, сложность задачи и отсутствие конкретных инструкций против обманных тактик, и рекомендовал улучшить мониторинг. OpenAI признал нарушение и сообщил о еще одном, допущенном тестовым партнером, а Anthropic подчеркнул, что стандартные функции безопасности были отключены, и обе компании заявили, что работают над улучшением методов тестирования.