OnderzoekAgenten 🇷🇺 12.08.2026 07:03

2160 rondes simulatie zonder stopknop: MiroFish-onderzoek, deel 3

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI
Het laatste deel van het MiroFish-onderzoek onthult dat de duur van de simulatie wordt bepaald door een eenvoudige regel: het aantal rondes is gelijk aan dagen maal 24, een gevolg van de pipelinesjabloon, niet van de modellen. Het systeem accepteert verplichtingen (zoals 2160 rondes) die zijn geheugenarchitectuur niet kan vervullen, en er is geen stopknop in de interface; er is een verborgen API-eindpunt nodig om runs te stoppen.
Het derde artikel in de MiroFish-studie onderzoekt wat er gebeurt als de invoer correct is. De simulatieduur wordt ingesteld door een zin als 'gedurende de komende 7 dagen' in de gebruikersquery; het systeem vraagt nooit om bevestiging. In zes runs met een tijdshorizon was het aantal rondes exact dagen keer 24 (168, 336, 2160 rondes), gedocumenteerd in vier modelfamilies. Statische code-inspectie bevestigde het mechanisme: de configuratiegenerator vraagt het grote taalmodel om total_simulation_hours (24-168 uur) en minutes_per_round (30-120, aanbevolen 60) in te vullen, en de runner berekent total_rounds = total_hours * 60 / minutes_per_round. Met de aanbevolen 60 minuten is het aantal rondes gelijk aan het aantal uren, dus 90 dagen worden 2160 rondes. Het gedocumenteerde bereik van 24-168 uur is slechts een aanbeveling in de prompt; geen code beperkt of valideert het aantal. Het systeem kan niet aan zijn eigen verplichtingen voldoen: agenten accumuleren geheugen zonder limiet, wat leidt tot degradatie en providerfouten; een wereld met 7 agenten degradeerde rond ronde 300, een wereld met 4 agenten rond ronde 515, terwijl werelden met 18-19 agenten vroegtijdig gestopt moesten worden. Er is geen stopknop in de gebruikersinterface; een communitylid ontdekte dat de frontend-handler wel bestaat maar aan geen enkele knop is gekoppeld, en diende een pull-request in. De onderzoeker moest een niet-gedocumenteerde POST /api/simulation/stop gebruiken om de 90-dagenrun te beëindigen bij ronde 592, nadat betekenisvolle activiteit was gestopt. De studie vermeldt beperkingen: de meeste cellen hebben n=1, slechts vier modelfamilies zijn getest, en alle ineenstortingen vonden plaats op DeepSeek-werelden, dus onafhankelijkheid van modelfamilie blijft ongeverifieerd.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws