MarathonMemBench: un nuevo benchmark para probar la memoria de tu agente LLM
Anthropic
MarathonMemBench es un nuevo tipo de plataforma de pruebas que evalúa la memoria a largo plazo de los agentes LLM a través de conversaciones naturales y prolongadas, sin necesidad de realizar modificaciones especiales en el agente. Se creó porque los benchmarks de memoria existentes requieren cargar diálogos pre-grabados (off-policy) o exigen capacidades adicionales del agente, como instantáneas de estado o acceso programático a la memoria. La plataforma está diseñada para ser agnóstico en cuanto al agente, requiriendo solo una interfaz de chat, y permite evaluar la capacidad de un agente para recordar y mantener hechos a lo largo de conversaciones largas que exceden la ventana de contexto.
El artículo presenta MarathonMemBench, una plataforma para evaluar el rendimiento de la memoria a largo plazo de los agentes LLM. El autor argumenta que la ventana de contexto finita de los modelos basados en transformadores es una limitación fundamental, y que los agentes deben utilizar herramientas de memoria externas, como escribir en archivos, para superarla. Los benchmarks de memoria existentes son criticados por requerir que los agentes estén especialmente adaptados: los benchmarks fuera de política (por ejemplo, LoCoMo, LongMemEval, MemoryAgentBench, BEAM) cargan diálogos pregrabados, mientras que los dentro de política (por ejemplo, AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) exigen instantáneas de estado, acceso programático a la memoria, u operar dentro de su propio entorno. MarathonMemBench, en cambio, funciona como una plataforma donde una persona con personalidad de LLM conversa con el agente durante horas, presenta hechos, los cambia y finalmente prueba la recuperación. Solo requiere que el agente tenga una interfaz de chat. El artículo esboza planes para futuras secciones que cubran los benchmarks existentes, la arquitectura de la plataforma y los resultados de agentes de código abierto, que fueron sorprendentemente sólidos.
Fuente: Habr — хаб ИИ —
original
