에이전트연구 🇷🇺 05.08.2026 14:02

MarathonMemBench: LLM 에이전트의 메모리를 테스트하는 새로운 벤치마크

AnthropicAnthropic
MarathonMemBench는 확장된 자연스러운 대화를 통해 LLM 에이전트의 장기 메모리를 테스트하는 새로운 유형의 벤치마크 플랫폼으로, 특별한 에이전트 수정이 필요하지 않습니다. 기존의 메모리 벤치마크는 사전 녹화된 대화를 로드하거나(오프 폴리시) 상태 스냅샷이나 프로그래밍 방식의 메모리 접근과 같은 추가 에이전트 기능을 요구했기 때문에 이를 개선하기 위해 만들어졌습니다. 이 플랫폼은 에이전트에 구애받지 않도록 설계되어 채팅 인터페이스만 있으면 되며, 컨텍스트 창을 초과하는 긴 대화에서 사실을 기억하고 유지하는 에이전트의 능력을 평가할 수 있습니다.
이 기사는 LLM 에이전트의 장기 기억을 벤치마킹하기 위한 플랫폼인 MarathonMemBench를 소개합니다. 저자는 트랜스포머 기반 모델의 유한한 컨텍스트 창이 근본적인 한계이며, 에이전트는 파일에 쓰는 것과 같은 외부 메모리 도구를 사용하여 이를 극복해야 한다고 주장합니다. 기존 메모리 벤치마크는 에이전트가 특별히 적응해야 한다는 점에서 비판을 받습니다. 오프-폴리시 벤치마크(예: LoCoMo, LongMemEval, MemoryAgentBench, BEAM)는 사전 기록된 대화를 로드하는 반면, 온-폴리시 벤치마크(예: AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark)는 상태 스냅샷, 프로그래밍 방식의 메모리 액세스 또는 자체 환경 내에서의 운영을 요구합니다. 대신 MarathonMemBench는 LLM 페르소나가 에이전트와 수시간 동안 대화하고, 사실을 제시하고, 변경하고, 마지막으로 회상을 테스트하는 플랫폼으로 실행됩니다. 에이전트에게는 채팅 인터페이스만 있으면 됩니다. 이 기사는 기존 벤치마크, 플랫폼의 아키텍처, 그리고 놀랍게도 강력했던 오픈소스 에이전트의 결과를 다루는 향후 섹션에 대한 계획을 설명합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스