Atribución Automática de Fallos en Sistemas Multiagente Basados en LLM: Nueva Investigación
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
Investigadores de la Universidad Estatal de Pensilvania y la Universidad de Duke, en colaboración con Google DeepMind, introdujeron la tarea de atribución automática de fallos en sistemas multiagente basados en modelos de lenguaje de gran escala (LLM, por sus siglas en inglés). Desarrollaron el punto de referencia Who&When con 127 registros de fallos y tres métodos de atribución (Todo a la vez, Paso a paso, Búsqueda binaria). Los experimentos mostraron que incluso los mejores modelos (GPT-4o, o1, DeepSeek R1) tienen un rendimiento deficiente: la precisión para identificar al agente responsable es de aproximadamente el 53.5 %, y el paso del error solo llega al 14.2 %.
Investigadores de la Universidad Estatal de Pensilvania y la Universidad de Duke, en colaboración con Google DeepMind, la Universidad de Washington, Meta, la Universidad Tecnológica de Nanyang y la Universidad Estatal de Oregón, han formalizado por primera vez la tarea de atribución automática de fallos en sistemas multiagente basados en modelos de lenguaje de gran tamaño (LLM). Crearon el primer punto de referencia, Who&When, que incluye 127 registros de fallos recopilados de sistemas de agentes LLM, tanto generados algorítmicamente como compuestos manualmente por expertos. Cada registro contiene anotaciones: el agente responsable (Quién), el paso del error (Cuándo) y una descripción de la causa (Por qué). Se proponen tres métodos para la tarea: Todo a la vez (análisis simultáneo de todo el registro), Paso a paso (revisión gradual) y Búsqueda binaria (búsqueda binaria en el registro). Los experimentos con GPT-4o mostraron que el mejor método individual logra un 53,5% de precisión en identificar al agente responsable y solo un 14,2% en señalar exactamente el paso del error. Ningún método supera la suposición aleatoria en muchas métricas. Incluso modelos avanzados como o1 y DeepSeek R1 tienen dificultades. Los enfoques híbridos mejoran los resultados pero aumentan significativamente los costos computacionales. A medida que aumenta la longitud del contexto, el rendimiento de todos los métodos disminuye, especialmente en la determinación del paso del error. El trabajo fue aceptado como Destacado en ICML 2025; el código y los datos son de código abierto.
Fuente: Synced —
original
