LLMベースのマルチエージェントシステムにおける自動的な責任帰属:新たな研究
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
ペンシルベニア州立大学とデューク大学の研究者がGoogle DeepMindと協力し、LLMベースのマルチエージェントシステムにおける自動的な障害原因の特定タスクを導入しました。彼らは127の障害ログと3つの帰属手法(All-at-Once、Step-by-Step、Binary Search)からなるWho&Whenベンチマークを開発しました。実験では、最も優れたモデル(GPT-4o、o1、DeepSeek R1)でもパフォーマンスは低く、責任のあるエージェントの特定精度は約53.5%、エラーのステップの特定精度はわずか14.2%でした。
ペンシルベニア州立大学とデューク大学の研究者らは、Google DeepMind、ワシントン大学、Meta、南洋理工大学、オレゴン州立大学と共同で、大規模言語モデル(LLM)に基づくマルチエージェントシステムにおける自動障害帰属のタスクを初めて形式化した。彼らは、アルゴリズム生成と専門家による手動作成の両方を含む、LLMエージェントシステムから収集した127件の障害ログを含む最初のベンチマーク、Who&Whenを作成した。各ログには、責任エージェント(Who)、エラーステップ(When)、原因の説明(Why)の注釈が含まれている。このタスクには、All-at-Once(ログ全体の同時分析)、Step-by-Step(段階的レビュー)、Binary Search(ログ上の二分探索)の3つの方法が提案されている。GPT-4oを用いた実験では、最良の単一方法で責任エージェントの特定精度が53.5%、エラーステップの正確な特定精度が14.2%に留まった。多くの指標で、どの方法もランダム推測を上回ることはなかった。o1やDeepSeek R1のような先進的なモデルでさえ苦戦している。ハイブリッドアプローチは結果を改善するが、計算コストを大幅に増加させる。コンテキスト長が増加するにつれて、全方法の性能は低下し、特にエラーステップの決定で顕著である。この研究はICML 2025でSpotlightとして採択され、コードとデータはオープンソース化されている。
出典: Synced —
原文
