에이전트연구 🇺🇸 27.07.2026 17:05

LLM 기반 다중 에이전트 시스템에서 자동 결함 귀속: 새로운 연구

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind OpenAIOpenAI DeepSeekDeepSeek
펜실베이니아 주립대학교와 듀크 대학교의 연구진이 Google DeepMind와 협력하여 LLM 기반 다중 에이전트 시스템에서 자동 결함 귀속 작업을 도입했습니다. 연구진은 127개의 결함 로그와 세 가지 귀속 방법(All-at-Once, Step-by-Step, Binary Search)을 포함한 Who&When 벤치마크를 개발했습니다. 실험 결과, 최고 성능 모델(GPT-4o, o1, DeepSeek R1)조차 성능이 낮았습니다: 책임 에이전트 식별 정확도는 약 53.5%, 오류 단계 식별 정확도는 14.2%에 불과했습니다.
来自宾夕法尼亚州立大学和杜克大学的研究人员,与谷歌DeepMind、华盛顿大学、Meta、南洋理工大学和俄勒冈州立大学合作,首次将基于大型语言模型(LLM)的多智能体系统中的自动故障归因任务形式化。他们创建了首个基准数据集Who&When,该数据集包含从LLM智能体系统中收集的127个故障日志,这些日志既有算法生成的,也有专家手动编写的。每个日志包含标注:负责的智能体(谁)、错误步骤(何时)以及原因描述(为什么)。针对该任务提出了三种方法:一次性分析(同时分析整个日志)、逐步审查(逐步检查)和二分搜索(在日志中进行二分搜索)。使用GPT-4o进行的实验表明,最佳单一方法在识别负责智能体方面准确率达到53.5%,但精确定位错误步骤的准确率仅为14.2%。在许多指标上,没有方法优于随机猜测。即使是o1和DeepSeek R1等高级模型也表现不佳。混合方法提高了结果,但显著增加了计算成本。随着上下文长度的增加,所有方法的性能都会下降,尤其是在确定错误步骤方面。该工作被ICML 2025接收为Spotlight论文;代码和数据已开源。
출처: Synced — 원문
관련 게시물 ↓
새로운 뉴스