Meta AI stelt tweede AI-agent voor om lange taken op koers te houden
Meta
Anthropic
Onderzoekers van Meta AI hebben een geheugenmodule ontwikkeld die gebruikmaakt van een afzonderlijke 'geheugenagent' om selectief herinneringen in te voegen in een 'actieagent' tijdens lange taken, waardoor 'verval van gedragstoestand' wordt voorkomen. Tests op Terminal-Bench 2.0 en τ2-Bench (tau-kwadraat-Bench) toonden significante verbeteringen, vooral voor zwakkere agenten, en de code is open source beschikbaar op GitHub.
In hun paper beschrijven onderzoekers van Meta AI een terugkerend probleem waarbij AI-agenten de vereisten uit het oog verliezen of mislukte acties herhalen tijdens langdurige taken, een fenomeen dat zij 'behavioral state decay' noemen. Zij stellen een plug-and-play geheugenmodule voor die een aparte 'geheugenagent' draait naast een ongewijzigde 'actieagent', die op vaste intervallen recente stappen observeert, een gestructureerd geheugenbestand bijwerkt en beslist of er een beknopte, op geheugen gebaseerde herinnering in de volgende actieoproep moet worden geïnjecteerd, of dat er moet worden gezwegen. Het geheugenbestand is verdeeld in privéstatus, kennis en procedurele herinneringen, en de agent beheert het bestand via vooraf gedefinieerde tooloproepen in plaats van vrij herschrijven. Tests werden uitgevoerd op Terminal-Bench 2.0 en τ2-Bench met Claude Opus 4.6 als geheugenagent. Met Claude Sonnet 4.5 als actieagent loste het systeem 46% van de Terminal-Bench-taken op bij de eerste poging, tegenover 38% eerder, en verbeterde het taakgewogen gemiddelde van τ2-Bench van 55% naar 62%, met opmerkelijke domeinverschillen: Airline en Retail verbeterden elk met ongeveer 10 procentpunten, terwijl Telecom slechts met 3% verbeterde. De sterkere Opus 4.6 verbeterde ook, maar in mindere mate, wat suggereert dat het voordeel verder gaat dan het compenseren van beperkte capaciteit. Ablatiestudies toonden aan dat selectieve interventie en een bijgehouden geheugenbestand essentieel zijn, en de aanpak presteerde beter dan de productieve geheugenlaag Mem0. Het team onderzocht ook het trainen van een open model, Qwen3.5-27B, als geheugenagent, en ontdekte dat supervised fine-tuning en reinforcement learning nodig waren om interventies goed te kalibreren. Meta AI heeft de code op GitHub gepubliceerd.
Bron: The Decoder (DE) —
origineel
