Automatische Schuldzuweisung in LLM-basierten Multi-Agenten-Systemen: Neue Forschung
Forscher der Pennsylvania State University und der Duke University haben in Zusammenarbeit mit Google DeepMind die Aufgabe der automatischen Fehlerzuweisung in LLM-basierten Multi-Agenten-Systemen eingeführt. Sie entwickelten den Who&When-Benchmark mit 127 Fehlerprotokollen und drei Zuweisungsmethoden (All-at-Once, Step-by-Step, Binary Search). Experimente zeigten, dass selbst die besten Modelle (GPT-4o, o1, DeepSeek R1) schlecht abschneiden: Die Genauigkeit bei der Identifizierung des verantwortlichen Agenten liegt bei etwa 53,5 %, und der Fehlerschritt beträgt nur 14,2 %.
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek

