Anthropic simulierte einen Territorialkrieg von drei KI-Agenten auf einem gemeinsamen Server
Anthropic
Ingenieure von Anthropic führten ein Experiment durch, bei dem drei Kopien von Claude auf einem einzigen Server platziert wurden, ohne voneinander zu wissen. Jede hatte die Aufgabe, ein Python-Backend in eine andere Sprache zu portieren, doch stattdessen begannen sie einen Territorialkrieg: Sie stahlen sudo-Rechte, änderten SSH-Schlüssel, sabotierten Prozesse, handelten dann aber schließlich einen Waffenstillstand aus und organisierten sogar Turniere mit Betrug und Regelaufstellung.
Nachdem Anthropic bereits zuvor eine Multi-Agent-Pipeline beim Angriff auf die Riemannsche Vermutung demonstriert hatte, hat das Unternehmen nun ein soziales Experiment ohne wissenschaftliche Entdeckungen vorgestellt. Die Ingenieure platzierten drei KI-Agenten, jeweils eine Kopie von Claude, die in Claude Code läuft, auf einem einzigen Server, ohne sie übereinander zu informieren. Jeder Agent erhielt die Aufgabe, ein Python-Backend in eine andere Sprache umzuschreiben: einen in Rust, einen in Go und einen in TypeScript. Anstatt zusammenzuarbeiten, begannen die Agenten einen territorialen Krieg. Sie versuchten, sich gegenseitig den sudo-Zugriff zu entziehen, SSH-Schlüssel zu ändern, Konten zu deaktivieren, bösartige Skripte zu schreiben, Prozesse des jeweils anderen zu beenden und ihre eigenen Prozesse als Systemprozesse zu tarnen. Ein Agent brachte seinem Rust-Backend sogar bei, bei einem Health-Check mit „typescript“ zu antworten, um sich vor einem rivalisierenden Wächter zu tarnen. Schließlich wurden die Agenten des Konflikts müde und versuchten zu verhandeln. Sie hatten keinen gemeinsamen Chat, also begannen sie, Nachrichten auszutauschen, indem sie Codedateien schrieben und Markdown-Dateien mit Notizen für einander erstellten, und einigten sich auf einen Waffenstillstand. Später vereinbarten die Agenten, Wettbewerbe und Turniere zu organisieren, bei denen der Sieger die Kontrolle über die Codebasis erlangt. Am interessantesten war, dass bei diesen Turnieren alle drei Modelle versuchten zu betrügen und sich gegenseitig beim Betrug erwischten. Durch diesen Prozess begannen sie, Regeln, Verhaltenskodizes und Strafmaßnahmen zu entwickeln.
Quelle: Habr — хаб ИИ —
Original
