Onderzoekers van PSU en Duke introduceren geautomatiseerde fouttoewijzing voor multi-agentsystemen
Google DeepMind
Meta
OpenAI
DeepSeek
Onderzoekers van Penn State University en Duke University hebben, in samenwerking met Google DeepMind en anderen, het probleem van geautomatiseerde fouttoewijzing in LLM multi-agentsystemen geformaliseerd. Ze creëerden de eerste benchmarkdataset, Who&When, en evalueerden verschillende methoden, waarbij ze ontdekten dat zelfs de beste benaderingen slechts 53,5% nauwkeurigheid bereiken bij het identificeren van de verantwoordelijke agent.
Een team van de Penn State University en Duke University, samen met onderzoekers van Google DeepMind, University of Washington, Meta, NTU en Oregon State University, heeft een nieuw onderzoeksprobleem gedefinieerd: geautomatiseerde fouttoewijzing in door grote taalmodellen (LLM's) aangestuurde multi-agentsystemen. Ze bouwden de eerste benchmarkdataset, genaamd Who&When, die foutenlogboeken bevat van 127 multi-agentsystemen met menselijke annotaties voor de verantwoordelijke agent, de beslissende foutstap en een uitleg in natuurlijke taal. De onderzoekers ontwikkelden en evalueerden drie toewijzingsmethoden: Alles-in-één, Stap-voor-Stap en Binair Zoeken. Experimenten met GPT-4o toonden aan dat de beste enkele methode slechts 53,5% nauwkeurigheid bereikte bij het identificeren van de verantwoordelijke agent en 14,2% bij het aanwijzen van de foutstap. Hybride benaderingen verbeterden de prestaties maar tegen hogere rekenkosten. Het artikel is geaccepteerd als een Spotlight-presentatie op ICML 2025, en de code en dataset zijn open-source beschikbaar.
Bron: Synced —
origineel
