эталонный набор данных Who&When, содержащий логи сбоев от 127 мультиагентных систем с аннотациями от людей, указывающими ответственного агента, решающий ошибочный шаг и пояснение на естественном языке. Исследователи разработали и оценили три метода атрибуции: "Всё сразу" (All-at-Once), "Пошагово" (Step-by-Step) и "Бинарный поиск" (Binary Search). Эксперименты с использованием GPT-4o показали, что наилучший единственный метод достигает точности всего 53,5% при определении ответственного агента и 14,2% при выявлении ошибочного шага. Гибридные подходы улучшили производительность, но за счёт более высоких вычислительных затрат. Статья принята для выступления в формате "Spotlight" на конференции ICML 2025, а код и набор данных опубликованы в открытом доступе.