Des chercheurs de la PSU et de Duke présentent l'attribution automatisée des défaillances pour les systèmes multi-agents
Google DeepMind
Meta
OpenAI
DeepSeek
Des chercheurs de la Penn State University et de la Duke University, en collaboration avec Google DeepMind et d'autres, ont formalisé le problème de l'attribution automatisée des défaillances dans les systèmes multi-agents basés sur des grands modèles de langage. Ils ont créé le premier jeu de données de référence, Who&When, et évalué plusieurs méthodes, constatant que même les meilleures approches n'atteignent qu'une précision de 53,5 % dans l'identification de l'agent responsable.
Une équipe de l'Université d'État de Pennsylvanie et de l'Université Duke, ainsi que des chercheurs de Google DeepMind, de l'Université de Washington, de Meta, de l'Université technologique de Nanyang (NTU) et de l'Université d'État de l'Oregon, a défini un nouveau problème de recherche : l'attribution automatisée des défaillances dans les systèmes multi-agents pilotés par LLM. Ils ont construit le premier ensemble de données de référence, Who&When, contenant des journaux de défaillances de 127 systèmes multi-agents avec des annotations humaines pour l'agent responsable, l'étape d'erreur décisive et une explication en langage naturel. Les chercheurs ont développé et évalué trois méthodes d'attribution : Tout-à-la-fois, Pas-à-pas, et Recherche binaire. Des expériences utilisant GPT-4o ont montré que la meilleure méthode unique atteignait seulement 53,5 % de précision dans l'identification de l'agent responsable et 14,2 % dans le repérage de l'étape d'erreur. Les approches hybrides ont amélioré les performances, mais à un coût de calcul plus élevé. L'article a été accepté comme présentation Spotlight à l'ICML 2025, et le code et l'ensemble de données sont en accès libre.
Source: Synced —
original
