Meta AI propone un segundo agente de IA para mantener las tareas largas en curso
Meta
Anthropic
Los investigadores de Meta AI han desarrollado un módulo de memoria que utiliza un "agente de memoria" separado para inyectar selectivamente recordatorios en un "agente de acción" durante tareas largas, evitando la "decadencia del estado conductual". Las pruebas en Terminal-Bench 2.0 y τ2-Bench mostraron mejoras significativas, especialmente para agentes más débiles, y el código está disponible en código abierto en GitHub.
En su artículo, los investigadores de Meta AI describen un problema recurrente en el que los agentes de IA pierden el seguimiento de los requisitos o repiten acciones fallidas en tareas largas, un fenómeno que denominan 'decaimiento del estado de comportamiento'. Proponen un módulo de memoria plug-and-play que ejecuta un 'agente de memoria' separado junto a un 'agente de acción' sin cambios, observando los pasos recientes a intervalos fijos, actualizando un banco de memoria estructurado y decidiendo si inyectar un recordatorio conciso basado en la memoria en la siguiente llamada de acción o permanecer en silencio. El banco de memoria se divide en estado privado, conocimiento y memorias procedimentales, y el agente gestiona el banco mediante llamadas a herramientas predefinidas en lugar de reescribirlo libremente. Las pruebas se realizaron en Terminal-Bench 2.0 y τ2-Bench con Claude Opus 4.6 como agente de memoria. Con Claude Sonnet 4.5 como agente de acción, el sistema resolvió el 46% de las tareas de Terminal-Bench en el primer intento, frente al 38%, y mejoró el promedio ponderado por tarea de τ2-Bench del 55% al 62%, con diferencias notables por dominio: Airline y Retail mejoraron aproximadamente 10 puntos porcentuales cada uno, mientras que Telecom solo mejoró 3. El Opus 4.6 más fuerte también mejoró, pero en menor medida, lo que sugiere que el beneficio va más allá de compensar la capacidad limitada. Las ablaciones mostraron que la intervención selectiva y un banco de memoria mantenido son clave, y el enfoque superó a la capa de memoria productiva Mem0. El equipo también exploró entrenar un modelo abierto, Qwen3.5-27B, como agente de memoria, y encontró que se necesitaban ajuste fino supervisado y aprendizaje por refuerzo para calibrar adecuadamente las intervenciones. Meta AI publicó el código en GitHub.
Fuente: The Decoder (DE) —
original
