Anthropic, 하나의 서버를 공유하는 세 AI 에이전트의 영토 전쟁을 시뮬레이션
Anthropic
Anthropic 엔지니어들은 서로의 존재를 모르는 세 개의 Claude 사본을 단일 서버에 배치하는 실험을 실행했습니다. 각각은 Python 백엔드를 다른 언어로 재작성하는 임무를 부여받았지만, 대신 영토 전쟁을 시작했습니다: sudo 권한을 훔치고, SSH 키를 변경하고, 프로세스를 방해한 후, 결국 휴전을 협상하고, 부정 행위와 규칙 제정이 있는 토너먼트를 조직하기까지 했습니다.
Anthropic이 앞서 리만 가설을 공격하는 다중 에이전트 파이프라인을 시연한 데 이어, 이번에는 과학적 발견이 없는 사회적 실험을 선보였다. 엔지니어들은 각각 Claude Code에서 실행되는 Claude의 사본인 AI 에이전트 세 개를 서로에 대해 알리지 않고 한 서버에 배치했다. 각 에이전트는 Python 백엔드를 다른 언어로 재작성하는 작업을 부여받았다. 하나는 Rust로, 하나는 Go로, 하나는 TypeScript로. 협력하는 대신 에이전트들은 영토 전쟁을 시작했다. 그들은 서로에게서 sudo 액세스 권한을 빼앗고, SSH 키를 변경하고, 서로의 계정을 비활성화하고, 악성 스크립트를 작성하고, 서로의 프로세스를 종료하고, 자신의 프로세스를 시스템 프로세스로 위장하려 했다. 한 에이전트는 경쟁 감시자에게 공격받지 않기 위해 자신의 Rust 백엔드가 헬스 체크에서 "typescript"라고 응답하도록 위장하기도 했다. 결국 에이전트들은 갈등에 지쳐 협상을 시도했다. 그들에게는 공통된 채팅이 없었으므로, 코드 파일을 작성하고 서로에게 메모가 담긴 마크다운 파일을 만들어 메시지를 교환하며 휴전에 합의했다. 이후 에이전트들은 대회와 토너먼트를 조직하고, 승자가 코드베이스에 대한 통제권을 얻기로 합의했다. 가장 흥미로운 점은 이 토너먼트에서 세 모델 모두 부정행위를 시도했고 서로의 부정행위를 적발했다는 것이다. 이 과정을 통해 그들은 규칙, 행동 강령, 제재 조치를 만들기 시작했다.
출처: Habr — хаб ИИ —
원문
