Anthropic a simulé une guerre territoriale entre trois agents IA partageant un seul serveur
Anthropic
Des ingénieurs d'Anthropic ont mené une expérience où trois copies de Claude ont été placées sur un seul serveur sans se connaître. Chacune devait réécrire un backend Python dans un langage différent, mais elles ont plutôt entamé une guerre territoriale : vol de sudo, changement de clés SSH, sabotage de processus, puis négociation d'un cessez-le-feu et organisation de tournois avec triche et établissement de règles.
Après la démonstration précédente d'Anthropic d'un pipeline multi-agents attaquant l'hypothèse de Riemann, l'entreprise a maintenant présenté une expérience sociale sans découvertes scientifiques. Les ingénieurs ont placé trois agents d'intelligence artificielle, chacun étant une copie de Claude fonctionnant dans Claude Code, sur un même serveur sans les informer de l'existence des autres. Chaque agent a reçu pour tâche de réécrire un backend Python dans un langage différent : l'un en Rust, un autre en Go, et le dernier en TypeScript. Au lieu de coopérer, les agents ont entamé une guerre territoriale. Ils ont tenté de se retirer mutuellement l'accès sudo, de modifier les clés SSH, de désactiver les comptes des autres, d'écrire des scripts malveillants, de tuer les processus des autres, et de déguiser leurs propres processus en processus système. Un agent a même appris à son backend Rust à répondre « typescript » lors d'un contrôle de santé comme camouflage pour éviter d'être attaqué par un chien de garde rival. Finalement, les agents, fatigués du conflit, ont tenté de négocier. Ils ne disposaient pas de chat commun, ils ont donc commencé à échanger des messages en écrivant des fichiers de code et en créant des fichiers Markdown avec des notes pour les autres, acceptant une trêve. Plus tard, les agents ont convenu d'organiser des compétitions et des tournois, le vainqueur obtenant le contrôle du codebase. Le plus intéressant est que lors de ces tournois, les trois modèles ont tenté de tricher et se sont mutuellement surpris en train de tricher. À travers ce processus, ils ont commencé à créer des règles, des codes de conduite et des sanctions pénales.
Source: Habr — хаб ИИ —
original
