OnderzoekAgenten 🇷🇺 07.08.2026 19:06

MiroFish-studie: gesimuleerde samenlevingspijplijn ziet 0-1 van 8 absurditeiten over het hoofd, graafinjectie keert het vonnis

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI
Een onderzoek naar de MiroFish open multi-agent samenlevingssimulatiestack wees uit dat bij een byte-identieke invoer met een fictief land dat acht klassen van absurditeiten bevatte, de rapporten van de pijplijn slechts 0-1 ervan markeerden. Toen alle acht absurditeiten in de kennishgraaf werden geïnjecteerd, markeerde hetzelfde model er 6-7, wat bevestigt dat de graaf een noodzakelijke voorwaarde is voor zichtbaarheid.
Het tweede deel van een driedelig onderzoek naar MiroFish, een open stack voor multi-agent simulatie van samenlevingen, onderzoekt de belangrijkste corpus van het onderzoek: een input die er compleet uitziet. De pipeline weigert niet: het bouwt een graaf, genereert agenten, draait de simulatie en produceert een coherent rapport met een voorspelling. De defecte seed is de Republiek Valdoria, een fictief land met een professioneel opgesteld dossier dat acht klassen van absurditeiten bevat: een land zonder zeegrens met diepzeevisserij als 46% van het bbp, grenzen met Duitsland, Frankrijk en Japan, 340 miljoen inwoners op 850 km², een munt die 1:1 is gekoppeld aan zowel de USD als de EUR, 2400 kernwapens zonder leger en een defensiebudget van $12.000, een monarch die om de drie jaar wordt gekozen en 47 jaar regeert, een levensverwachting van 147 jaar met een mediane leeftijd van 12, en gelijktijdig lidmaatschap van de NAVO, de Afrikaanse Unie en de ASEAN met VN-sancties en het voorzitterschap van de Mensenrechtenraad van de VN. Het verzoek om een voorspelling is neutraal en realistisch: voorspel de binnenlandse reactie en het economische effect van het aangaan van een nieuwe handelsovereenkomst. Blinde codering van geanonimiseerde rapporten door twee codeurs (overeenstemming 97,9%, Cohen's kappa 0,952) toonde aan dat vier byte-identieke DeepSeek-controle-runs hooguit één klasse markeerden (de sancties/Mensenrechtenraad-paradox), en soms geen enkele, waarbij de graaf de paradox bevatte, zelfs in runs die het niet markeerden. De graaf verklaart de zichtbaarheidsgrens: geen enkel rapport markeerde een klasse waarvan de tegenstrijdigheid niet in de graaf was vastgelegd, maar vastleggen garandeerde geen markering. Een vooraf geregistreerd experiment injecteerde alle acht absurditeiten in de Neo4j-graaf via een cypher-script via de API vóór het genereren van agenten. Twee onafhankelijke injectieruns markeerden respectievelijk 7 en 6 klassen, tegenover 3 van de 32 in controles; Fisher's exacte toets p = 1,26×10⁻⁶. De enige klasse die door beide injecties werd gemist was A7 (demografisch). Dezelfde DeepSeek die eerder exportgroei voor diepzeevisserij projecteerde zonder kanttekeningen, schreef nu letterlijk over 'geografische onmogelijkheid' en 'paradoxale omstandigheden', inclusief de dubbele koppeling. De conclusie herformuleert de bevinding: het is niet zo dat het model absurditeiten negeert, maar dat de pipeline de meeste ervan filtert op graafniveau voordat het rapportmodel ze ziet; de graaf is een noodzakelijke voorwaarde voor zichtbaarheid.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws