AgentesPesquisa 🇫🇷 10.08.2026 18:01

Agentes de IA: Paralelize o Trabalho Sem Paralelizar Erros

OpenAIOpenAI AnthropicAnthropic
Um estudo de pesquisadores, incluindo a Anthropic, apresenta um benchmark chamado Horizon e analisa mais de 3.100 trajetórias de agentes. Os resultados mostram que o desempenho dos agentes de IA pode colapsar abruptamente além de uma certa complexidade de tarefa, com 72,5% das falhas atribuídas a riscos relacionados ao processo. A Anthropic aconselha dividir projetos independentes em vez de fases.
Pesquisadores desenvolveram um benchmark chamado Horizon e analisaram mais de 3.100 trajetórias de agentes em vários ambientes, incluindo web, sistemas operacionais, bancos de dados e configurações incorporadas. Os experimentos envolveram agentes usando modelos da OpenAI e da Anthropic. As descobertas revelam que o desempenho não degrada gradualmente à medida que as tarefas se alongam, mas pode permanecer estável e então colapsar abruptamente além de um certo limiar. Sete grandes categorias de falhas foram identificadas, agrupadas em duas famílias: 72,5% das falhas associadas a riscos relacionados ao processo e 27,5% a riscos de design do agente. A Anthropic destaca um fenômeno chamado 'poluição de contexto', onde informações intermediárias acumuladas obstruem o contexto do agente e prejudicam o julgamento. O estudo sugere que dividir uma tarefa em subtarefas independentes tratadas por agentes separados funciona, enquanto dividir fases como design, implementação e teste, que compartilham muito contexto, leva à perda de informações semelhante ao jogo do telefone sem fio. Para executivos, quatro perguntas são fundamentais: quem tomou a decisão, com base em quais informações, a que custo, e se um único passo falho pode ser repetido de forma independente. Sem reexecutabilidade, incidentes recomeçam tudo, e uma divisão inadequada pode custar de 3 a 10 vezes mais do que um único agente.
Fonte: Le Monde Informatique — IA — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas