Automatische schuldtoewijzing in LLM-gebaseerde multi-agent systemen: nieuw onderzoek
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
Onderzoekers van Penn State University en Duke University, in samenwerking met Google DeepMind, introduceerden de taak van automatische fouttoewijzing in LLM-gebaseerde multi-agent systemen. Ze ontwikkelden de Who&When-benchmark met 127 foutlogs en drie toewijzingsmethoden (All-at-Once, Step-by-Step, Binary Search). Experimenten toonden aan dat zelfs de beste modellen (GPT-4o, o1, DeepSeek R1) slecht presteren: de nauwkeurigheid bij het identificeren van de verantwoordelijke agent is ongeveer 53,5% en de foutstap wordt slechts 14,2% correct geïdentificeerd.
Onderzoekers van Pennsylvania State University en Duke University, in samenwerking met Google DeepMind, University of Washington, Meta, Nanyang Technological University en Oregon State University, hebben voor het eerst de taak van automatische fouttoewijzing in multi-agentsystemen op basis van grote taalmodellen (LLM's) geformaliseerd. Ze creëerden de eerste benchmark, Who&When, die 127 foutenlogboeken bevat die zijn verzameld uit LLM-agentsystemen, zowel algoritmisch gegenereerd als handmatig samengesteld door experts. Elk logboek bevat annotaties: de verantwoordelijke agent (Who), de foutstap (When) en een beschrijving van de oorzaak (Why). Er worden drie methoden voorgesteld voor de taak: All-at-Once (gelijktijdige analyse van het hele logboek), Step-by-Step (stapsgewijze beoordeling) en Binary Search (binair zoeken over het logboek). Experimenten met GPT-4o toonden aan dat de beste enkele methode 53,5% nauwkeurigheid behaalt bij het identificeren van de verantwoordelijke agent en slechts 14,2% bij het exact pinpointen van de foutstap. Geen enkele methode presteert beter dan willekeurig raden op veel metrieken. Zelfs geavanceerde modellen zoals o1 en DeepSeek R1 worstelen. Hybride benaderingen verbeteren de resultaten, maar verhogen de rekenkosten aanzienlijk. Naarmate de contextlengte toeneemt, neemt de prestaties van alle methoden af, vooral bij het bepalen van de foutstap. Het werk is geaccepteerd als een Spotlight op ICML 2025; code en data zijn open-source.
Bron: Synced —
origineel
