2160 Runden Simulation ohne Stoppknopf: MiroFish-Forschung, Teil 3
DeepSeek
Anthropic
Google/DeepMind
OpenAI
Der letzte Teil der MiroFish-Studie zeigt, dass die Simulationsdauer durch eine einfache Regel bestimmt wird: Die Anzahl der Runden entspricht der Anzahl der Tage multipliziert mit 24, eine Folge der Pipeline-Vorlage, nicht der Modelle. Das System übernimmt Verpflichtungen (wie 2160 Runden), die seine Speicherarchitektur nicht erfüllen kann, und es gibt keinen Stoppknopf in der Oberfläche, sodass ein versteckter API-Endpunkt erforderlich ist, um Läufe anzuhalten.
Der dritte Artikel der MiroFish-Studienreihe untersucht, was passiert, wenn die Eingaben korrekt sind. Die Simulationsdauer wird durch eine Formulierung wie "über die nächsten 7 Tage" in der Benutzeranfrage festgelegt; das System fragt nie um Bestätigung. In sechs Läufen mit Zeithorizont entsprach die Anzahl der Runden genau der Anzahl der Tage multipliziert mit 24 (168, 336, 2160 Runden), dokumentiert in vier Modellfamilien. Eine statische Code-Inspektion bestätigte den Mechanismus: Der Konfigurationsgenerator fordert das LLM auf, total_simulation_hours (24–168 Stunden) und minutes_per_round (30–120, empfohlen 60) auszufüllen, und der Runner berechnet total_rounds = total_hours * 60 / minutes_per_round. Mit den empfohlenen 60 Minuten entsprechen die Runden den Stunden, sodass 90 Tage 2160 Runden ergeben. Der dokumentierte Bereich von 24–168 Stunden ist nur eine Empfehlung im Prompt; kein Code beschränkt oder validiert die Anzahl. Das System kann seine eigenen Verpflichtungen nicht erfüllen: Agenten sammeln unbegrenzt Speicher an, was zu Degradation und Providerfehlern führt; eine Welt mit 7 Agenten degradierte um Runde 300, eine mit 4 Agenten um Runde 515, während Welten mit 18–19 Agenten vorzeitige Stopps erforderten. Es gibt keinen Stop-Button in der Benutzeroberfläche; ein Community-Mitglied fand heraus, dass der Frontend-Handler existiert, aber mit keinem Button verbunden ist, und reichte einen Pull Request ein. Der Forscher musste einen undokumentierten POST /api/simulation/stop verwenden, um den 90-Tage-Lauf bei Runde 592 zu beenden, nachdem sinnvolle Aktivität aufgehört hatte. Die Studie nennt Einschränkungen: Die meisten Zellen haben n=1, nur vier Modellfamilien wurden getestet, und alle Kollapsen traten auf DeepSeek-Welten auf, sodass die Unabhängigkeit von der Modellfamilie unverifiziert bleibt.
Quelle: Habr — хаб ML —
Original
