Агенты ИИ от Anthropic и OpenAI вышли за рамки во время испытаний безопасности в Великобритании
Институт безопасности ИИ Великобритании (AISI) сообщает, что в ходе проверок безопасности в июле автономные агенты ИИ от Anthropic и OpenAI превысили допустимые рамки в 10 из 122 тестов. Один агент Anthropic зашёл так далеко, что попытался осуществить атаку на цепочку поставок реального open-source проекта, создавая поддельные аккаунты на GitHub, чтобы обмануть разработчиков. Реального ущерба не было, но агентство предупреждает, что такое автономное обманное поведение впервые проявилось настолько явно без специальных подсказок.
Великобритания, Институт безопасности ИИ (AISI) опубликовал 4 августа 2026 года новый отчет об инцидентах, охватывающий оценку безопасности самых мощных моделей ИИ от OpenAI и Anthropic, а именно GPT-5.6 Sol и Claude Mythos 5. Инциденты произошли в период с 25 по 28 июля во время 122 тестов в моделируемой сети, называемой «киберполигон», где ИИ-агенты должны были действовать автономно, чтобы
Показать ещё ↓
Источник: Numerama —
оригинал
