エージェント研究 🇷🇺 05.08.2026 14:02

MarathonMemBench:LLMエージェントのメモリをテストする新しいベンチマーク

AnthropicAnthropic
MarathonMemBenchは、長時間の自然な会話を通じてLLMエージェントの長期記憶をテストする新しいタイプのベンチマークプラットフォームであり、特別なエージェントの変更を必要としません。既存のメモリベンチマークは、事前に記録された対話を読み込む(オフポリシー)か、状態スナップショットやプログラムによるメモリアクセスなどの追加のエージェント機能を要求するため、このプラットフォームが作成されました。MarathonMemBenchはエージェントに依存しないように設計されており、チャットインターフェースのみを必要とし、コンテキストウィンドウを超える長い会話中に事実を思い出し維持するエージェントの能力を評価できます。
この記事では、LLMエージェントの長期記憶を評価するためのプラットフォームであるMarathonMemBenchを紹介します。著者は、トランスフォーマーベースのモデルの有限なコンテキストウィンドウが根本的な制限であり、エージェントはファイルへの書き込みなどの外部メモリツールを使用してこの制限を克服する必要があると主張しています。既存のメモリベンチマークは、エージェントが特別に適応することを要求するため批判されています。オフポリシーのベンチマーク(例:LoCoMo、LongMemEval、MemoryAgentBench、BEAM)は事前に記録されたダイアログを読み込みますが、オンポリシーのベンチマーク(例:AMemGym、MEMPROBE、MemoryArena、STATE-Bench、MemGym、ClawMark)は状態スナップショット、プログラムによるメモリへのアクセス、または独自の環境内での動作を要求します。代わりに、MarathonMemBenchは、LLMのペルソナがエージェントと何時間にもわたって会話し、事実を提示し、変更し、最後に想起をテストするプラットフォームとして動作します。必要なのは、エージェントがチャットインターフェースを持っていることだけです。この記事では、既存のベンチマーク、プラットフォームのアーキテクチャ、そして驚くほど強力だったオープンソースエージェントの結果を取り上げる今後のセクションの計画を概説しています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース