Atribuição Automática de Falhas em Sistemas Multiagente Baseados em LLM: Nova Pesquisa
Google/DeepMind
Google DeepMind
OpenAI
DeepSeek
Pesquisadores da Penn State University e da Duke University, em colaboração com o Google DeepMind, introduziram a tarefa de atribuição automática de falhas em sistemas multiagente baseados em LLM. Eles desenvolveram o benchmark Who&When com 127 registros de falhas e três métodos de atribuição (All-at-Once, Step-by-Step, Binary Search). Experimentos mostraram que mesmo os melhores modelos (GPT-4o, o1, DeepSeek R1) têm desempenho fraco: a precisão na identificação do agente responsável é de cerca de 53,5%, e o passo do erro é de apenas 14,2%.
Pesquisadores da Pennsylvania State University e da Duke University, em colaboração com Google DeepMind, University of Washington, Meta, Nanyang Technological University e Oregon State University, formalizaram pela primeira vez a tarefa de atribuição automática de falhas em sistemas multiagentes baseados em grandes modelos de linguagem (LLMs, na sigla em inglês). Eles criaram o primeiro benchmark, Who&When, que inclui 127 logs de falhas coletados de sistemas de agentes LLM, tanto gerados algoritmicamente quanto compostos manualmente por especialistas. Cada log contém anotações: o agente responsável (Who), o passo do erro (When) e uma descrição da causa (Why). Três métodos são propostos para a tarefa: All-at-Once (análise simultânea de todo o log), Step-by-Step (revisão passo a passo) e Binary Search (busca binária sobre o log). Experimentos com o GPT-4o mostraram que o melhor método individual alcança 53,5% de precisão na identificação do agente responsável e apenas 14,2% na determinação exata do passo do erro. Nenhum método supera a escolha aleatória em muitas métricas. Mesmo modelos avançados, como o1 e DeepSeek R1, têm dificuldades. Abordagens híbridas melhoram os resultados, mas aumentam significativamente os custos computacionais. À medida que o comprimento do contexto aumenta, o desempenho de todos os métodos diminui, especialmente na determinação do passo do erro. O trabalho foi aceito como Spotlight no ICML 2025; o código e os dados são de código aberto.
Fonte: Synced —
original
