エージェント研究 🇺🇸 28.07.2026 23:03

PSUとデューク大学の研究者がマルチエージェントシステム向け自動障害属性評価を導入

Google DeepMindGoogle DeepMind MetaMeta OpenAIOpenAI DeepSeekDeepSeek
ペンシルベニア州立大学とデューク大学の研究者らが、Google DeepMindなどと協力し、LLMマルチエージェントシステムにおける自動障害属性評価の問題を形式化しました。彼らは最初のベンチマークデータセット「Who&When」を作成し、複数の手法を評価したところ、最良の手法でも原因エージェントの特定精度は53.5%にとどまることがわかりました。
ペンシルベニア州立大学とデューク大学のチームは、Google DeepMind、ワシントン大学、Meta、南洋理工大学、オレゴン州立大学の研究者と共同で、新たな研究課題を定義しました。それは、大規模言語モデル(LLM)駆動型のマルチエージェントシステムにおける自動故障原因特定です。彼らは、127のマルチエージェントシステムからの故障ログと、責任のあるエージェント、決定的なエラーステップ、自然言語による説明に対する人間によるアノテーションを含む、初のベンチマークデータセット「Who&When」を構築しました。研究者らは、「All-at-Once」、「Step-by-Step」、「Binary Search」の3つの原因特定手法を開発し評価しました。GPT-4oを用いた実験では、最良の単一手法でも責任エージェントの特定精度は53.5%、エラーステップの特定精度は14.2%にとどまりました。ハイブリッドアプローチは性能を向上させましたが、計算コストが増大しました。本論文はICML 2025でスポットライト発表として採択されており、コードとデータセットはオープンソース化されています。
出典: Synced — 原文
関連記事 ↓
新着ニュース