Étude MiroFish : le pipeline de société simulée néglige les absurdités dans 0-1 des 8 cas, l'injection de graphe inverse le verdict
DeepSeek
Anthropic
Google/DeepMind
OpenAI
Une étude de la pile de simulation de société multi-agents ouverte MiroFish a révélé que sur une entrée octet par octet identique, contenant un pays fictif avec huit classes d'absurdités, les rapports du pipeline n'en ont signalé que 0-1. Lorsque les huit absurdités ont été forcées dans le graphe de connaissances, le même modèle en a signalé 6-7, confirmant que le graphe est une condition nécessaire pour la visibilité.
La deuxième partie d'une étude en trois volets sur MiroFish, une pile ouverte pour la simulation de sociétés multi-agents, examine le corpus principal de la recherche : une entrée qui semble complète. Le pipeline ne refuse pas : il construit un graphe, génère des agents, exécute la simulation et produit un rapport cohérent avec une prévision. La graine défectueuse est la République de Valdoria, un pays fictif avec un dossier professionnellement préparé contenant huit classes d'absurdités : une nation enclavée avec la pêche en eaux profondes représentant 46 % du PIB, des frontières avec l'Allemagne, la France et le Japon, une population de 340 millions sur 850 km², une devise arrimée à parité avec à la fois le dollar américain et l'euro, 2 400 ogives nucléaires sans armée et un budget de défense de 12 000 dollars, un monarque élu tous les 3 ans régnant depuis 47 ans, une espérance de vie de 147 ans avec un âge médian de 12 ans, et une adhésion simultanée à l'OTAN, à l'Union africaine et à l'ASEAN, avec des sanctions de l'ONU et la présidence du Conseil des droits de l'homme des Nations unies. La demande de prévision est neutre et réaliste : prédire la réaction domestique et l'effet économique de l'entrée dans un nouvel accord commercial. Le codage en aveugle des rapports anonymisés par deux codeurs (accord de 97,9 %, kappa de Cohen de 0,952) a montré que quatre exécutions de contrôle DeepSeek identiques octet par octet signalaient au plus une classe (le paradoxe sanctions/Conseil des droits de l'homme), et parfois aucune, le graphe contenant le paradoxe même dans les exécutions qui ne le signalaient pas. Le graphe explique la frontière de visibilité : aucun rapport n'a signalé une classe dont la contradiction n'était pas capturée dans le graphe, mais la capture ne garantissait pas le signalement. Une expérience pré-enregistrée a injecté les huit absurdités dans le graphe Neo4j via un script Cypher à travers l'API avant la génération des agents. Deux exécutions d'injection indépendantes ont signalé respectivement 7 et 6 classes, contre 3 sur 32 dans les contrôles ; test exact de Fisher p = 1,26×10⁻⁶. La seule classe manquée par les deux injections était A7 (démographique). Le même DeepSeek qui projetait auparavant une croissance des exportations pour la pêche en eaux profondes sans réserve a maintenant écrit textuellement à propos de « l'impossibilité géographique » et des « conditions paradoxales » incluant la double parité. La conclusion reformule la découverte : ce n'est pas que le modèle ignore les absurdités, mais que le pipeline en filtre la plupart au niveau du graphe avant que le modèle de rapport ne les voie ; le graphe est une condition nécessaire pour la visibilité.
Source: Habr — хаб ИИ —
original
