Tác tửNghiên cứu 🇺🇸 27.07.2026 17:05

Tự động quy lỗi trong hệ thống đa tác tử dựa trên LLM: Nghiên cứu mới

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind OpenAIOpenAI DeepSeekDeepSeek
Các nhà nghiên cứu từ Đại học Penn State và Đại học Duke, hợp tác với Google DeepMind, đã giới thiệu nhiệm vụ tự động quy lỗi trong hệ thống đa tác tử dựa trên mô hình ngôn ngữ lớn (LLM). Họ phát triển bộ tiêu chuẩn Who&When gồm 127 nhật ký lỗi và ba phương pháp quy lỗi (All-at-Once, Step-by-Step, Binary Search). Các thử nghiệm cho thấy ngay cả các mô hình tốt nhất (GPT-4o, o1, DeepSeek R1) cũng hoạt động kém: độ chính xác trong việc xác định tác tử chịu trách nhiệm chỉ khoảng 53,5% và bước lỗi chỉ đạt 14,2%.
来自宾夕法尼亚州立大学和杜克大学的研究人员,与谷歌深度思维、华盛顿大学、Meta、南洋理工大学和俄勒冈州立大学合作,首次正式确立了基于大型语言模型(LLM)的多智能体系统中的自动故障归因任务。他们创建了第一个基准测试,称为“谁与何时”(Who&When),其中包含从基于LLM的智能体系统中收集的127个故障日志,这些日志既有通过算法生成的,也有由专家手动编写的。每个日志都包含注释:负责的智能体(谁)、错误步骤(何时)以及原因描述(为什么)。为此任务提出了三种方法:一次性全量分析(同时分析整个日志)、逐步审查(逐步审查)和二分搜索(对日志进行二分搜索)。使用GPT-4o进行的实验表明,最佳单一方法在识别负责智能体方面的准确率为53.5%,而在精确定位错误步骤方面的准确率仅为14.2%。在许多指标上,没有任何方法能超过随机猜测。即使是像o1和DeepSeek R1这样的先进模型也表现不佳。混合方法能改善结果,但会显著增加计算成本。随着上下文长度的增加,所有方法的性能都会下降,尤其是在确定错误步骤方面。这项工作被ICML 2025接收为亮点论文;代码和数据已开源。
Nguồn: Synced — bản gốc
Bài viết liên quan trước đây ↓
Tin mới