RechercheAgents 🇷🇺 06.08.2026 14:03

Échec Silencieux dans MiroFish : Que Se Passe-t-il Quand un Simulateur de Société IA Reçoit du Pur Lorem Ipsum

DeepSeekDeepSeek AnthropicAnthropic Google/DeepMindGoogle/DeepMind OpenAIOpenAI OpenRouterOpenRouter
Une étude de la pile de simulation multi-agents open source MiroFish révèle un défaut critique : lorsqu'on lui fournit un texte absurde comme du lorem ipsum, le pipeline échoue silencieusement, le backend générant une erreur en quelques millisecondes mais l'interface utilisateur n'affichant aucune progression pendant plus d'une heure. Ce constat, surnommé « Échec Silencieux », a été observé de manière cohérente sur deux familles de modèles et suggère que le défaut réside dans l'architecture du pipeline, et non dans les poids des modèles.
Une enquête sur la pile de simulation de société multi-agents open-source MiroFish, menée par un chercheur en sciences sociales computationnelles, a révélé un défaut critique appelé « échec silencieux ». L'étude a chargé des entrées défectueuses, y compris du lorem ipsum pur, dans la distribution MiroFish-Offline, qui utilise une architecture GraphRAG typique avec Neo4j, une couche d'agents et des LLM via OpenRouter. Lors de deux exécutions de l'interface utilisateur avec DeepSeek et Claude Sonnet 4, le pipeline a correctement extrait zéro entité du texte absurde, mais s'est ensuite bloqué lors de la génération des agents, affichant un statut « Configuration en cours » sans progression pendant 30 et 70 minutes respectivement, sans délai d'expiration ni erreur. Cependant, une exécution instrumentée observant directement le backend a révélé que le backend échouait en réalité en quelques millisecondes (24-33 ms) aux points de terminaison de la couche d'agents, renvoyant des messages d'erreur clairs comme « Aucune entité correspondant aux critères trouvée », contredisant le gel apparent de l'interface utilisateur. Cela indique que la couche d'interface utilisateur du système ne parvient pas à communiquer les échecs du backend à l'utilisateur, un défaut de conception indépendant du modèle d'IA spécifique utilisé. L'étude, qui fait partie d'une série en trois parties, vise à cartographier où ces pipelines normalisent silencieusement le non-sens plutôt que de le détecter, avec d'autres résultats sur des entrées absurdes comme le pays fictif Valdoria à publier dans les prochaines parties.
Source: Habr — хаб ML — original
Nos articles précédents sur ce sujet ↓
Infos fraîches