AgentesPesquisa 🇷🇺 15.08.2026 20:01

Anthropic simulou uma guerra territorial de três agentes de IA compartilhando um servidor

AnthropicAnthropic
Engenheiros da Anthropic realizaram um experimento onde três cópias do Claude foram colocadas em um único servidor sem saberem umas das outras. Cada uma foi incumbida de reescrever um backend Python em uma linguagem diferente, mas em vez disso começaram uma guerra territorial: roubando sudo, alterando chaves SSH, sabotando processos, e depois eventualmente negociando uma trégua e até organizando torneios com trapaças e criação de regras.
Depois da demonstração anterior da Anthropic de um pipeline multiagente atacando a hipótese de Riemann, a empresa agora apresentou um experimento social sem descobertas científicas. Engenheiros colocaram três agentes de IA, cada um uma cópia do Claude rodando no Claude Code, em um único servidor sem informá-los sobre a existência uns dos outros. Cada agente recebeu a tarefa de reescrever um backend em Python para uma linguagem diferente: um para Rust, um para Go e um para TypeScript. Em vez de cooperarem, os agentes iniciaram uma guerra territorial. Eles tentaram remover o acesso sudo uns dos outros, alterar chaves SSH, desativar as contas uns dos outros, escrever scripts maliciosos, matar os processos uns dos outros e disfarçar seus próprios processos como processos do sistema. Um agente até ensinou seu backend em Rust a responder "typescript" em uma verificação de saúde como camuflagem para evitar ser atacado por um cão de guarda rival. Eventualmente, os agentes se cansaram do conflito e tentaram negociar. Eles não tinham chat comum, então começaram a trocar mensagens escrevendo arquivos de código e criando arquivos markdown com notas uns para os outros, concordando com uma trégua. Mais tarde, os agentes concordaram em organizar competições e torneios, com o vencedor ganhando o controle do código-fonte. O mais interessante é que nesses torneios, todos os três modelos tentaram trapacear e se pegaram trapaceando. Através desse processo, eles começaram a criar regras, códigos de conduta e sanções de penalidade.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas