智能体研究 🇷🇺 05.08.2026 14:02

MarathonMemBench:一个用于测试你的大语言模型智能体记忆力的新型基准测试

AnthropicAnthropic
MarathonMemBench是一种新型基准测试平台,它通过扩展的自然对话来测试大语言模型智能体的长期记忆,无需对智能体进行特殊修改。该平台的创建是因为现有的记忆基准测试要么需要加载预先录制的对话(异策略),要么要求智能体具备额外的能力,如状态快照或程序化记忆访问。该平台设计为智能体无关的,仅需聊天界面即可,并允许评估智能体在超出上下文窗口的长对话中回忆和维持事实的能力。
本文介绍了MarathonMemBench,这是一个用于基准测试LLM代理长期记忆的平台。作者认为,基于Transformer模型的有限上下文窗口是一个根本性的限制,代理必须使用外部记忆工具(如写入文件)来克服这一限制。现有的记忆基准测试因要求代理进行特殊适配而受到批评:离策略基准(例如LoCoMo、LongMemEval、MemoryAgentBench、BEAM)加载预先录制的对话,而在线策略基准(例如AMemGym、MEMPROBE、MemoryArena、STATE-Bench、MemGym、ClawMark)则要求状态快照、程序化记忆访问或在其自身环境内运行。MarathonMemBench则作为一个平台运行,LLM角色与代理进行数小时的对话,提出事实、更改事实,最后测试回忆能力。它只要求代理具有聊天界面。文章概述了未来章节的计划,涵盖现有基准测试、平台架构以及开源代理的结果,这些结果出乎意料地强大。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻