AgentesInvestigación 🇺🇸 28.07.2026 23:03

Investigadores de PSU y Duke presentan atribución automatizada de fallos para sistemas multiagente

Google DeepMindGoogle DeepMind MetaMeta OpenAIOpenAI DeepSeekDeepSeek
Investigadores de la Universidad Estatal de Pensilvania y la Universidad de Duke, en colaboración con Google DeepMind y otros, han formalizado el problema de la atribución automatizada de fallos en sistemas multiagente basados en modelos de lenguaje de gran escala (LLM). Crearon el primer conjunto de datos de referencia, Who&When, y evaluaron varios métodos, encontrando que incluso los mejores enfoques alcanzan solo un 53,5 % de precisión al identificar al agente responsable.
Un equipo de la Universidad Estatal de Pensilvania, la Universidad de Duke, junto con investigadores de Google DeepMind, la Universidad de Washington, Meta, la Universidad Tecnológica de Nanyang (NTU) y la Universidad Estatal de Oregón, ha definido un nuevo problema de investigación: la atribución automatizada de fallos en sistemas multiagente basados en grandes modelos de lenguaje (LLM). Construyeron el primer conjunto de datos de referencia, Who&When, que contiene registros de fallos de 127 sistemas multiagente con anotaciones humanas sobre el agente responsable, el paso de error decisivo y una explicación en lenguaje natural. Los investigadores desarrollaron y evaluaron tres métodos de atribución: Todos a la vez, Paso a paso y Búsqueda binaria. Los experimentos con GPT-4o mostraron que el mejor método individual logró solo un 53,5% de precisión al identificar al agente responsable y un 14,2% al localizar el paso de error. Los enfoques híbridos mejoraron el rendimiento, pero a un mayor costo computacional. El artículo ha sido aceptado como presentación destacada (Spotlight) en ICML 2025, y el código y el conjunto de datos son de código abierto.
Fuente: Synced — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas