Pesquisadores da PSU e Duke Apresentam Atribuição Automatizada de Falhas para Sistemas Multiagentes
Google DeepMind
Meta
OpenAI
DeepSeek
Pesquisadores da Penn State University e Duke University, em colaboração com o Google DeepMind e outros, formalizaram o problema da atribuição automatizada de falhas em sistemas multiagentes baseados em grandes modelos de linguagem. Eles criaram o primeiro conjunto de dados de referência, Who&When, e avaliaram vários métodos, descobrindo que mesmo as melhores abordagens alcançam apenas 53,5% de precisão na identificação do agente responsável.
Uma equipe da Universidade Estadual da Pensilvânia e da Universidade Duke, juntamente com pesquisadores do Google DeepMind, da Universidade de Washington, da Meta, da NTU e da Universidade Estadual do Oregon, definiu um novo problema de pesquisa: atribuição automatizada de falhas em sistemas multiagentes baseados em LLM. Eles construíram o primeiro conjunto de dados de referência, chamado Who&When, contendo registros de falhas de 127 sistemas multiagentes com anotações humanas para o agente responsável, a etapa de erro decisiva e uma explicação em linguagem natural. Os pesquisadores desenvolveram e avaliaram três métodos de atribuição: Tudo de Uma Vez, Passo a Passo e Busca Binária. Experimentos usando o GPT-4o mostraram que o melhor método individual atingiu apenas 53,5% de precisão na identificação do agente responsável e 14,2% na localização da etapa de erro. Abordagens híbridas melhoraram o desempenho, mas com maior custo computacional. O artigo foi aceito como apresentação em destaque no ICML 2025, e o código e o conjunto de dados foram disponibilizados como código aberto.
Fonte: Synced —
original
