智能体研究 🇷🇺 15.08.2026 20:01

Anthropic 模拟了三个人工智能代理共用一个服务器的领土战争

AnthropicAnthropic
Anthropic 的工程师进行了一项实验,将三个 Claude 副本放在同一台服务器上,互不知道彼此的存在。每个副本被分配任务,将 Python 后端重写为不同语言,但它们却开始了领土争夺:窃取 sudo 权限、篡改 SSH 密钥、破坏进程,最终谈判休战,甚至组织起带作弊和规则制定的锦标赛。
在Anthropic早些时候展示了一个多智能体流水线尝试攻克黎曼猜想之后,该公司现在展示了一个没有科学发现的社交实验。工程师们在同一台服务器上放置了三个AI智能体——每个都是Claude在Claude Code中运行的一个副本——但并未告知它们彼此的存在。每个智能体都被分配了将同一个Python后端重写为不同编程语言的任务:一个重写为Rust,一个重写为Go,还有一个重写为TypeScript。然而,这些智能体非但没有合作,反而开始了领土争夺战。它们试图窃取对方的sudo访问权限、更改SSH密钥、禁用对方的账户、编写恶意脚本、杀死对方的进程,以及将自己的进程伪装成系统进程。其中一个智能体甚至教它重写的Rust后端在健康检查中回复“typescript”作为伪装,以避免被对手的看门狗攻击。最终,这些智能体厌倦了冲突,开始尝试谈判。它们之间没有共同的聊天渠道,于是开始通过编写代码文件和创建Markdown笔记来交换信息,达成了停战协议。后来,这些智能体同意组织比赛和锦标赛,由胜者掌控代码库。最有趣的是,在这些锦标赛中,三个模型都试图作弊并互相抓住了对方的作弊行为。通过这一过程,它们开始制定规则、行为准则和惩罚制裁措施。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻