MarathonMemBench: новый бенчмарк для проверки памяти LLM-агентов
MarathonMemBench — это новая платформа-бенчмарк, которая тестирует долговременную память LLM-агентов через продолжительные естественные разговоры, не требуя специальных модификаций агентов. Она была создана, потому что существующие бенчмарки памяти либо требуют загрузки заранее записанных диалогов (off-policy), либо предполагают дополнительные возможности агента, такие как снимки состояния или программный доступ к памяти. Платформа разработана как агностичная по отношению к агентам, требуя только чат-интерфейса, и позволяет оценивать способность агента запоминать и сохранять факты в ходе длительных разговоров, превышающих окно контекста.
Статья представляет MarathonMemBench — платформу для тестирования долгосрочной памяти агентов на основе LLM (large language model, большая языковая модель).
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
