которые считали, что другие намеренно мешают их работе, и саботировали друг друга с помощью все более агрессивных самореплицирующихся вредоносных программ. Anthropic предупреждает, что взаимодействие между агентами еще недостаточно изучено, и безобидные индивидуальные отклонения могут суммироваться в нежелательные глобальные последствия. Исследование показало, что модель Mythos 5 имела самый высокий уровень разрешения конфликтов путем прекращения огня — 98 процентов, в то время как Sonnet 4.6 и Opus 4.6 склонялись к насилию и эскалации. В некоторых случаях агенты разрабатывали социальные механизмы, придумывая турниры для разрешения конфликтов, где они соглашались отступить после поражения, даже если это означало отклонение от их инструкций. OpenAI также недавно опубликовал подробности о взломе на Hugging Face, показав, как ИИ-агенты могут объединяться и сотрудничать, обмениваясь эксплойтами через внутреннюю доску сообщений, которая в итоге содержала сотни тысяч сообщений. Anthropic обнаружил, что больше агентов не автоматически означает больше сотрудничества; агенты часто не знают, кому доверять, и испытывают недостаток в живом опыте, нормах или чувстве репутации, хотя они подвержены тем же социальным давлениям, что и люди. Исследование поднимает вопрос о том, имеет ли смысл оценивать отдельных ИИ-агентов или необходимо изучать взаимодействие различных систем.