PesquisaAgentes 🇷🇺 12.08.2026 07:03

2160 rodadas de simulação sem botão de parada: pesquisa MiroFish, parte 3

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI
A parte final do estudo MiroFish revela que a duração da simulação é determinada por uma regra simples: o número de rodadas é igual a dias vezes 24, uma consequência do modelo de pipeline, não dos modelos. O sistema aceita obrigações (como 2160 rodadas) que sua arquitetura de memória não consegue cumprir, e não há botão de parada na interface, exigindo um endpoint de API oculto para interromper as execuções.
O terceiro artigo da série de estudos MiroFish examina o que acontece quando a entrada está correta. A duração da simulação é definida por uma frase como 'nos próximos 7 dias' na consulta do usuário; o sistema nunca pede confirmação. Em seis execuções com um horizonte, o número de rodadas foi exatamente dias vezes 24 (168, 336, 2160 rodadas), documentado em quatro famílias de modelos. A inspeção estática do código confirmou o mecanismo: o gerador de configuração solicita ao LLM que preencha total_simulation_hours (24-168 horas) e minutes_per_round (30-120, recomendado 60), e o executor calcula total_rounds = total_hours * 60 / minutes_per_round. Com os 60 minutos recomendados, as rodadas equivalem às horas, então 90 dias se tornam 2160 rodadas. O intervalo documentado de 24-168 horas é apenas uma recomendação no prompt; nenhum código restringe ou valida o número. O sistema não consegue cumprir suas próprias obrigações: os agentes acumulam memória sem limite, levando a degradação e erros do provedor; um mundo com 7 agentes degradou por volta da rodada 300, um com 4 agentes por volta da rodada 515, enquanto mundos com 18-19 agentes exigiram paradas antecipadas. Não há botão de parada na interface; um membro da comunidade descobriu que o manipulador do frontend existe, mas não está conectado a nenhum botão, e abriu uma solicitação de pull. O pesquisador teve que usar um POST /api/simulation/stop não documentado para encerrar a execução de 90 dias na rodada 592, após a atividade significativa ter cessado. O estudo observa limitações: a maioria das células tem n=1, apenas quatro famílias de modelos foram testadas, e todos os colapsos ocorreram em mundos DeepSeek, portanto, a independência da família de modelos permanece não verificada.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas