Attribution automatique des fautes dans les systèmes multi-agents basés sur LLM : nouvelle recherche
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
Des chercheurs de la Pennsylvania State University et de l'Université Duke, en collaboration avec Google DeepMind, ont introduit la tâche d'attribution automatique des fautes dans les systèmes multi-agents basés sur les grands modèles de langage. Ils ont développé le benchmark Who&When avec 127 journaux de fautes et trois méthodes d'attribution (All-at-Once, Step-by-Step, Binary Search). Les expériences ont montré que même les meilleurs modèles (GPT-4o, o1, DeepSeek R1) obtiennent de mauvais résultats : la précision dans l'identification de l'agent responsable est d'environ 53,5 %, et l'étape d'erreur n'est que de 14,2 %.
Des chercheurs de l'Université d'État de Pennsylvanie et de l'Université Duke, en collaboration avec Google DeepMind, l'Université de Washington, Meta, l'Université technologique de Nanyang et l'Université d'État de l'Oregon, ont formalisé pour la première fois la tâche d'attribution automatique des fautes dans les systèmes multi-agents basés sur de grands modèles de langage (LLM). Ils ont créé le premier benchmark, Who&When, qui comprend 127 journaux de fautes collectés à partir de systèmes d'agents LLM, à la fois générés algorithmiquement et composés manuellement par des experts. Chaque journal contient des annotations : l'agent responsable (Qui), l'étape d'erreur (Quand) et une description de la cause (Pourquoi). Trois méthodes sont proposées pour la tâche : Tout-d'un-coup (analyse simultanée de l'ensemble du journal), Pas-à-pas (examen progressif) et Recherche binaire (recherche binaire sur le journal). Les expériences avec GPT-4o ont montré que la meilleure méthode unique atteint 53,5 % de précision pour identifier l'agent responsable et seulement 14,2 % pour localiser exactement l'étape d'erreur. Aucune méthode ne surpasse le hasard sur de nombreuses métriques. Même les modèles avancés comme o1 et DeepSeek R1 échouent. Les approches hybrides améliorent les résultats mais augmentent considérablement les coûts de calcul. À mesure que la longueur du contexte augmente, les performances de toutes les méthodes diminuent, surtout pour déterminer l'étape d'erreur. Les travaux ont été acceptés comme Spotlight à ICML 2025 ; le code et les données sont en open source.
Source: Synced —
original
