TutkimusAgentit 🇷🇺 12.08.2026 07:03

2160 kierrosta simulointia ilman pysäytyspainiketta: MiroFish-tutkimus, osa 3

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI
MiroFish-tutkimuksen viimeinen osa paljastaa, että simuloinnin kesto määräytyy yksinkertaisen säännön mukaan: kierrosten määrä on päivien määrä kertaa 24, mikä johtuu putkiston mallista, ei malleista itsestään. Järjestelmä hyväksyy sitoumuksia (kuten 2160 kierrosta), joita sen muistiarkkitehtuuri ei pysty täyttämään, eikä käyttöliittymässä ole pysäytyspainiketta, vaan ajot on pysäytettävä piilotetun sovellusrajapinnan kautta.
MiroFish-tutkimussarjan kolmannessa artikkelissa tarkastellaan, mitä tapahtuu, kun syöte on oikea. Simulaation pituus asetetaan käyttäjän kyselyssä olevalla ilmauksella, kuten 'seuraavan 7 päivän aikana'; järjestelmä ei koskaan pyydä vahvistusta. Kuudessa ajossa, joissa oli horisontti, kierrosten määrä oli täsmälleen päivien lukumäärä kertaa 24 (168, 336, 2160 kierrosta), ja se dokumentoitiin neljässä malliperheessä. Staattinen kooditarkastus vahvisti mekanismin: konfiguraatiogeneraattori kehottaa LLM:ää täyttämään kentät total_simulation_hours (24-168 tuntia) ja minutes_per_round (30-120, suositeltu 60), ja suoritin laskee total_rounds = total_hours * 60 / minutes_per_round. Suositellulla 60 minuutilla kierrosten määrä vastaa tunteja, joten 90 päivää tarkoittaa 2160 kierrosta. Dokumentoitu alue 24-168 tuntia on vain suositus kehotteessa; mikään koodi ei rajoita tai validoi lukua. Järjestelmä ei pysty täyttämään omia velvoitteitaan: agentit kerryttävät muistia rajattomasti, mikä johtaa suorituskyvyn heikkenemiseen ja palveluntarjoajan virheisiin; 7-agentin maailma heikkeni noin kierroksen 300 kohdalla, 4-agentin maailma noin kierroksen 515 kohdalla, kun taas 18-19 agentin maailmat vaativat varhaisen lopetuksen. Käyttöliittymässä ei ole stop-painiketta; yhteisön jäsen huomasi, että frontend-käsittelijä on olemassa, mutta sitä ei ole kytketty mihinkään painikkeeseen, ja teki vetopyynnön. Tutkijan oli käytettävä dokumentoimatonta POST /api/simulation/stop -pyyntöä päättääkseen 90 päivän ajon kierroksella 592, kun merkityksellinen toiminta oli jo lakannut. Tutkimuksessa huomautetaan rajoituksista: useimmat solut ovat n=1, vain neljä malliperhettä testattiin, ja kaikki romahdukset tapahtuivat DeepSeek-maailmoissa, joten riippumattomuus malliperheestä on edelleen vahvistamatta.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset