2160 rondas de simulación sin botón de parada: investigación MiroFish, parte 3
DeepSeek
Anthropic
Google/DeepMind
OpenAI
La parte final del estudio MiroFish revela que la duración de la simulación está determinada por una regla simple: el número de rondas es igual a los días multiplicados por 24, una consecuencia de la plantilla de pipeline, no de los modelos. El sistema acepta obligaciones (como 2160 rondas) que su arquitectura de memoria no puede cumplir, y no hay ningún botón de parada en la interfaz, por lo que se requiere un endpoint de API oculto para detener las ejecuciones.
El tercer artículo de la serie de estudios MiroFish examina qué sucede cuando la entrada es correcta. La duración de la simulación se establece mediante una frase como 'durante los próximos 7 días' en la consulta del usuario; el sistema nunca pide confirmación. En seis ejecuciones con horizonte temporal, el número de rondas fue exactamente días multiplicado por 24 (168, 336, 2160 rondas), documentado en cuatro familias de modelos. La inspección estática del código confirmó el mecanismo: el generador de configuración solicita al LLM que complete total_simulation_hours (24-168 horas) y minutes_per_round (30-120, recomendado 60), y el ejecutor calcula total_rounds = total_hours * 60 / minutes_per_round. Con los 60 minutos recomendados, las rondas equivalen a las horas, por lo que 90 días se convierten en 2160 rondas. El rango documentado de 24-168 horas es solo una recomendación en el prompt; ningún código restringe o valida el número. El sistema no puede cumplir con sus propias obligaciones: los agentes acumulan memoria sin límite, lo que provoca degradación y errores del proveedor; un mundo de 7 agentes se degradó alrededor de la ronda 300, un mundo de 4 agentes alrededor de la ronda 515, mientras que mundos de 18-19 agentes requirieron detenciones tempranas. No hay botón de detener en la interfaz; un miembro de la comunidad descubrió que el manejador del frontend existe pero no está conectado a ningún botón, y presentó una solicitud de extracción. El investigador tuvo que usar un endpoint no documentado POST /api/simulation/stop para terminar la ejecución de 90 días en la ronda 592, después de que cesara la actividad significativa. El estudio señala limitaciones: la mayoría de las celdas son n=1, solo se probaron cuatro familias de modelos, y todos los colapsos ocurrieron en mundos DeepSeek, por lo que la independencia de la familia de modelos sigue sin verificarse.
Fuente: Habr — хаб ML —
original
