MarathonMemBench: Een Nieuwe Benchmark om het Geheugen van Je LLM-agent te Testen
Anthropic
MarathonMemBench is een nieuw type benchmarkplatform dat het langetermijngeheugen van LLM-agents test via langdurige, natuurlijke gesprekken, zonder dat er speciale aanpassingen aan de agent nodig zijn. Het is ontwikkeld omdat bestaande geheugenbenchmarks ofwel vooraf opgenomen dialogen laden (off-policy) ofwel extra agentmogelijkheden vereisen, zoals statussnapshots of programmatische geheugentoegang. Het platform is ontworpen om agent-onafhankelijk te zijn en vereist alleen een chatinterface, waardoor het mogelijk is om te evalueren hoe goed een agent feiten kan onthouden en behouden tijdens lange gesprekken die de contextvenster overschrijden.
Het artikel introduceert MarathonMemBench, een platform voor het benchmarken van het langetermijngeheugen van LLM-agenten. De auteur stelt dat de eindige contextvenster van op transformatoren gebaseerde modellen een fundamentele beperking is, en dat agenten externe geheugentools, zoals het schrijven naar bestanden, moeten gebruiken om dit te overwinnen. Bestaande geheugenbenchmarks worden bekritiseerd omdat ze vereisen dat agenten speciaal worden aangepast: off-policy-benchmarks (bijv. LoCoMo, LongMemEval, MemoryAgentBench, BEAM) laden vooraf opgenomen dialogen, terwijl on-policy-benchmarks (bijv. AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) statussnapshots, programmatische geheugentoegang of het werken binnen hun eigen omgeving vereisen. MarathonMemBench draait daarentegen als een platform waar een LLM-persona gedurende uren met de agent converseert, feiten presenteert, deze verandert en ten slotte het herinneren test. Het vereist alleen dat de agent een chatinterface heeft. Het artikel schetst plannen voor toekomstige secties die bestaande benchmarks, de architectuur van het platform en resultaten van open-source-agenten behandelen, die verrassend sterk waren.
Bron: Habr — хаб ИИ —
origineel
