Meta AI propõe um segundo agente de IA para manter tarefas longas no caminho certo
Meta
Anthropic
Pesquisadores da Meta AI desenvolveram um módulo de memória que usa um 'agente de memória' separado para injetar lembretes seletivamente em um 'agente de ação' durante tarefas longas, evitando a 'degradação do estado comportamental'. Testes no Terminal-Bench 2.0 e no τ2-Bench mostraram melhorias significativas, especialmente para agentes mais fracos, e o código foi disponibilizado como código aberto no GitHub.
Em seu artigo, os pesquisadores da Meta AI descrevem um problema recorrente em que agentes de IA perdem o controle dos requisitos ou repetem ações falhas ao longo de tarefas longas, um fenômeno que eles chamam de 'decadência do estado comportamental'. Eles propõem um módulo de memória plug-and-play que executa um 'agente de memória' separado, junto com um 'agente de ação' inalterado, observando etapas recentes em intervalos fixos, atualizando um banco de memória estruturado e decidindo se deve injetar um lembrete conciso baseado em memória na próxima chamada de ação ou permanecer em silêncio. O banco de memória é dividido em status privado, conhecimento e memórias processuais, e o agente gerencia o banco por meio de chamadas de ferramentas predefinidas, em vez de reescrita livre. Testes foram conduzidos no Terminal-Bench 2.0 e no τ2-Bench com o Claude Opus 4.6 como agente de memória. Com o Claude Sonnet 4.5 como agente de ação, o sistema resolveu 46% das tarefas do Terminal-Bench na primeira tentativa, ante 38%, e melhorou a média ponderada por tarefa do τ2-Bench de 55% para 62%, com diferenças notáveis por domínio: Airline e Retail melhoraram em cerca de 10 pontos percentuais cada, enquanto Telecom melhorou apenas 3. O Opus 4.6, mais forte, também melhorou, mas em menor grau, sugerindo que o benefício vai além de compensar a capacidade limitada. Ablações mostraram que a intervenção seletiva e um banco de memória mantido são fundamentais, e a abordagem superou a camada de memória produtiva Mem0. A equipe também explorou treinar um modelo aberto, Qwen3.5-27B, como agente de memória, descobrindo que o ajuste fino supervisionado e o aprendizado por reforço eram necessários para calibrar adequadamente as intervenções. A Meta AI publicou o código no GitHub.
Fonte: The Decoder (DE) —
original
