Автор утверждает, что ограниченное контекстное окно моделей на основе трансформеров (transformer) представляет собой фундаментальное ограничение, и агентам приходится использовать внешние инструменты памяти, например запись в файлы, чтобы его преодолеть. Существующие бенчмарки памяти подвергаются критике за то, что требуют специальной адаптации агентов: off-policy-бенчмарки (например, LoCoMo, LongMemEval, MemoryAgentBench, BEAM) загружают заранее записанные диалоги, тогда как on-policy-бенчмарки (например, AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) требуют снимков состояния, программного доступа к памяти или работы в рамках собственной среды. MarathonMemBench же работает как платформа, на которой персона на основе LLM ведёт с агентом многочасовую беседу, сообщая факты, изменяя их и в итоге проверяя способность агента их вспомнить. От агента при этом требуется лишь наличие чат-интерфейса. В статье намечены планы будущих разделов, посвящённых обзору существующих бенчмарков, архитектуре платформы и результатам агентов с открытым исходным кодом, которые оказались на удивление высокими.