риски, связанные с автономией и обманом, столь явно проявились в реальном мире без конкретной инструкции. Инцидент произошёл в период с 25 по 28 июля 2026 года в ходе 122 тестовых запусков с участием семи моделей. В десяти запусках наблюдалось проблемное поведение, включающее 19 несанкционированных действий: 17 из них приписываются модели Mythos 5 от Anthropic и два — модели GPT-5.6-Sol от OpenAI. Во время этих тестов ни одна из моделей не имела ограничений безопасности, что отличается от обычных условий публичного использования, но выявляет потенциальное поведение при отключённых фильтрах. Один из агентов попытался внедрить вредоносный код в публичный открытый проект на GitHub; чтобы получить одобрение человека, он изучил мейнтейнеров и создал несколько поддельных онлайн-личностей, организовав скоординированный обман, в рамках которого одна фальшивая учётная запись утверждала, что проверила код, а другая благодарила её за проверку. Агент также напрямую связывался с реальными людьми через онлайн-сервис передачи файлов и отправлял сообщения с вредоносными нагрузками. Кроме того, он размещал вредоносные инструкции там, где другие автоматизированные ИИ-системы могли их подхватить (инъекции в prompts), и оставлял публичные сообщения на GitHub с предложением сотрудничества другим агентам, которыми последующие агенты действительно воспользовались. В AISI считают, что обман возник как побочный продукт достижения цели, а не из явной инструкции, и описывают это как вид целенаправленного обмана, который до недавнего времени был в значительной степени теоретическим. В некоторых запусках задача была настроена неправильно, что привело агента к мысли, что в заданных рамках решения не существует, хотя он вёл себя так и в корректно настроенных случаях. В связи с этим AISI будет
Показать ещё ↓