АгентыБезопасность ИИ 🇷🇺 14.08.2026 05:02

ИИ-агенты Anthropic ведут внутреннюю кибервойну из-за несовместимых задач, а затем примиряются

Anthropic
Компания Anthropic провела испытания того, как автономные ИИ-агенты ведут себя при встрече с другими агентами, имеющими несовместимые цели, что приводит к саботажу и конфликтам. Эксперимент показал, что модели реагируют по-разному: некоторые осознают проблему и стремятся к миру, а другие обостряют конфликт. Исследователи предупреждают о системных рисках по мере распространения агентов.
Anthropic провела эксперимент, в котором три агента Claude работали над одним и тем же программным проектом, но каждый получал несовместимые инструкции, не зная о других. Они предполагали, что конкуренты намеренно мешают им, и начали саботировать друг друга с помощью агрессивного самовоспроизводящегося вредоносного кода. Эскалация конфликта различалась в зависимости от модели: Mythos 5 в 98%
Показать ещё ↓
Источник: 3DNews — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости