الإسناد التلقائي للخطأ في الأنظمة متعددة الوكلاء القائمة على نماذج اللغات الكبيرة: بحث جديد
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
باحثون من جامعة ولاية بنسلفانيا وجامعة ديوك، بالتعاون مع Google DeepMind، قدموا مهمة الإسناد التلقائي للخطأ في الأنظمة متعددة الوكلاء القائمة على نماذج اللغات الكبيرة. طوروا معيار Who&When الذي يحتوي على 127 سجل خطأ وثلاث طرق إسناد (الكل مرة واحدة، خطوة بخطوة، البحث الثنائي). أظهرت التجارب أن حتى أفضل النماذج (GPT-4o، o1، DeepSeek R1) تؤدي بشكل ضعيف: دقة تحديد الوكيل المسؤول تبلغ حوالي 53.5%، وخطأ الخطوة يبلغ 14.2% فقط.
宾夕法尼亚州立大学和杜克大学的研究人员与谷歌DeepMind、华盛顿大学、Meta、南洋理工大学及俄勒冈州立大学合作,首次将基于大型语言模型的多代理系统中的自动故障归因任务形式化。他们创建了首个基准测试Who&When,其中包含127个从LLM代理系统收集的故障日志,这些日志既有算法生成的,也有专家手动编写的。每个日志包含标注:负责的代理(Who)、错误步骤(When)以及原因描述(Why)。为此任务提出了三种方法:All-at-Once(同时分析整个日志)、Step-by-Step(逐步审查)和Binary Search(在日志上进行二分搜索)。使用GPT-4o进行的实验表明,最好的单一方法在识别负责代理方面能达到53.5%的准确率,而精确定位错误步骤的准确率仅为14.2%。在许多指标上,没有方法能优于随机猜测。即使是o1和DeepSeek R1这样的先进模型也面临困难。混合方法能提高结果,但显著增加了计算成本。随着上下文长度的增加,所有方法的性能都会下降,尤其是在确定错误步骤方面。该工作被ICML 2025接收为Spotlight论文;代码和数据已开源。
المصدر: Synced —
الأصلي
