宾州州立大学与杜克大学研究人员提出多智能体系统自动化故障归因方法
Google DeepMind
Meta
OpenAI
DeepSeek
宾州州立大学和杜克大学的研究人员与 Google DeepMind 等机构合作,正式定义了大规模语言模型多智能体系统中自动化故障归因的问题。他们创建了首个基准数据集 Who&When,并对多种方法进行了评估,发现即便最佳方法的准确率也仅有 53.5%。
宾夕法尼亚州立大学和杜克大学的团队,与谷歌DeepMind、华盛顿大学、Meta、南洋理工大学和俄勒冈州立大学的研究人员合作,定义了一个新的研究问题:基于大语言模型(LLM)的多智能体系统中的自动化故障归因。他们构建了首个基准数据集Who&When,包含127个多智能体系统的故障日志,并附带人工标注的责任智能体、决定性错误步骤以及自然语言解释。研究人员开发并评估了三种归因方法:一次性归因(All-at-Once)、逐步归因(Step-by-Step)和二分搜索归因(Binary Search)。使用GPT-4o进行的实验表明,最佳单一方法在识别责任智能体时的准确率仅为53.5%,在定位错误步骤时的准确率仅为14.2%。混合方法提升了性能,但计算成本更高。该论文已被ICML 2025接收为亮点报告(Spotlight presentation),代码和数据集已开源。
来源: Synced —
原文
