MarathonMemBench: Um Novo Benchmark para Testar a Memória do seu Agente de LLM
Anthropic
MarathonMemBench é um novo tipo de plataforma de benchmark que testa a memória de longo prazo de agentes de LLM por meio de conversas naturais e estendidas, evitando a necessidade de modificações especiais no agente. Foi criado porque os benchmarks de memória existentes ou exigem carregar diálogos pré-gravados (off-policy) ou demandam capacidades adicionais do agente, como snapshots de estado ou acesso programático à memória. A plataforma é projetada para ser agnóstica em relação ao agente, exigindo apenas uma interface de chat, e permite a avaliação da capacidade de um agente de recordar e manter fatos ao longo de conversas longas que excedem a janela de contexto.
O artigo apresenta o MarathonMemBench, uma plataforma para avaliar a memória de longo prazo de agentes LLM. O autor argumenta que a janela de contexto finita dos modelos baseados em transformadores é uma limitação fundamental, e os agentes devem usar ferramentas de memória externa, como escrever em arquivos, para superá-la. Os benchmarks de memória existentes são criticados por exigirem que os agentes sejam especialmente adaptados: benchmarks off-policy (por exemplo, LoCoMo, LongMemEval, MemoryAgentBench, BEAM) carregam diálogos pré-gravados, enquanto os on-policy (por exemplo, AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) exigem snapshots de estado, acesso programático à memória ou operação dentro do próprio ambiente. O MarathonMemBench, em vez disso, opera como uma plataforma onde uma persona LLM conversa com o agente por horas, apresentando fatos, alterando-os e, finalmente, testando a recordação. Ele apenas requer que o agente tenha uma interface de chat. O artigo delineia planos para seções futuras que cobrem benchmarks existentes, a arquitetura da plataforma e resultados de agentes de código aberto, que foram surpreendentemente fortes.
Fonte: Habr — хаб ИИ —
original
