Автоматическое определение виновника сбоя в мультиагентных системах на LLM: новое исследование
Исследователи из Университета штата Пенсильвания и Университета Дьюка совместно с Google DeepMind представили задачу автоматической атрибуции сбоев в мультиагентных системах на основе LLM. Разработан бенчмарк Who&When с 127 журналами сбоев, а также три метода атрибуции (All-at-Once, Step-by-Step, Binary Search). Эксперименты показали, что даже лучшие модели (GPT-4o, o1, DeepSeek R1) справляются плохо: точность определения ответственного агента около 53.5%, шага ошибки — лишь 14.2%.
Исследователи из Университета штата Пенсильвания и Университета Дьюка совместно с Google DeepMind, Университетом Вашингтона, Meta, Наньянским технологическим университетом и Университетом штата Орегон впервые формализовали задачу автоматической атрибуции ошибок в мультиагентных системах на основе больших языковых моделей (LLM). Они создали первый бенчмарк Who&When, включающий 127 журналов ошибок,
Показать ещё ↓
Источник: Synced —
оригинал
