собранных из систем на основе LLM-агентов, как сгенерированных алгоритмически, так и составленных экспертами вручную. Каждый журнал содержит аннотации: ответственный агент (Who), этап ошибки (When) и описание причины (Why). Для решения задачи предлагаются три метода: All-at-Once (одновременный анализ всего журнала), Step-by-Step (пошаговый анализ) и Binary Search (бинарный поиск по журналу). Эксперименты с GPT-4o показали, что лучший одиночный метод достигает точности 53,5% в определении ответственного агента и лишь 14,2% в точном указании этапа ошибки. Ни один метод не превосходит случайное угадывание по многим метрикам. Даже продвинутые модели, такие как o1 и DeepSeek R1, испытывают трудности. Гибридные подходы улучшают результаты, но значительно увеличивают вычислительные затраты. С увеличением длины контекста производительность всех методов снижается, особенно при определении этапа ошибки. Работа принята как Spotlight на ICML 2025; код и данные находятся в открытом доступе.