LLM多智能体系统中的自动错误归因:新研究
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
来自宾夕法尼亚州立大学和杜克大学的研究人员,与Google DeepMind合作,提出了基于LLM的多智能体系统中的自动错误归因任务。他们构建了包含127个错误日志的Who&When基准测试,并开发了三种归因方法(一次性、逐步、二分搜索)。实验表明,即使最佳模型(GPT-4o、o1、DeepSeek R1)的表现也很差:识别责任智能体的准确率约为53.5%,错误步骤定位仅为14.2%。
来自宾夕法尼亚州立大学和杜克大学的研究人员,与谷歌深度思维、华盛顿大学、Meta、南洋理工大学以及俄勒冈州立大学合作,首次形式化定义了基于大规模语言模型(LLM)的多智能体系统中的自动故障归因任务。他们创建了首个基准测试 Who&When,其中包含从LLM智能体系统中收集的127份故障日志,既有算法生成的,也有专家手工编写的。每份日志都包含标注:责任智能体(谁)、错误步骤(何时)以及原因描述(为什么)。针对该任务,他们提出了三种方法:一次性分析(同时分析整个日志)、逐步检查(逐步审查)以及二分搜索(在日志中进行二分搜索)。使用GPT-4o进行的实验表明,最佳单一方法在识别责任智能体方面准确率达到53.5%,而在精确定位错误步骤方面仅为14.2%。在许多指标上,没有任何方法能超越随机猜测。即使是像o1和DeepSeek R1这样的高级模型也难以应对。混合方法虽然改进了结果,但显著增加了计算成本。随着上下文长度的增加,所有方法的性能都会下降,尤其是在确定错误步骤方面。该工作被ICML 2025接收为亮点论文;代码和数据已开源。
来源: Synced —
原文
