AgentenForschung 🇷🇺 05.08.2026 14:02

MarathonMemBench: Ein neuer Benchmark zum Testen des Gedächtnisses Ihres LLM-Agenten

AnthropicAnthropic
MarathonMemBench ist eine neue Art von Benchmark-Plattform, die das Langzeitgedächtnis von LLM-Agenten durch erweiterte, natürliche Gespräche testet, ohne dass spezielle Agentenmodifikationen erforderlich sind. Sie wurde entwickelt, weil bestehende Gedächtnis-Benchmarks entweder das Laden vorab aufgezeichneter Dialoge (off-policy) erfordern oder zusätzliche Agentenfähigkeiten wie Zustands-Snapshots oder programmatischen Speicherzugriff verlangen. Die Plattform ist so konzipiert, dass sie agentenunabhängig ist, nur eine Chat-Schnittstelle benötigt, und die Bewertung der Fähigkeit eines Agenten ermöglicht, Fakten über lange Gespräche hinweg abzurufen und zu behalten, die den Kontextfenster überschreiten.
Der Artikel stellt MarathonMemBench vor, eine Plattform zum Benchmarking des Langzeitgedächtnisses von LLM-Agenten. Der Autor argumentiert, dass der begrenzte Kontextfenster von transformerbasierten Modellen eine grundlegende Einschränkung darstellt und Agenten externe Gedächtniswerkzeuge, wie das Schreiben in Dateien, nutzen müssen, um diese zu überwinden. Bestehende Gedächtnis-Benchmarks werden dafür kritisiert, dass sie von Agenten verlangen, speziell angepasst zu sein: Off-Policy-Benchmarks (z. B. LoCoMo, LongMemEval, MemoryAgentBench, BEAM) laden vorab aufgezeichnete Dialoge, während On-Policy-Benchmarks (z. B. AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) Zustands-Snapshots, programmatischen Gedächtniszugriff oder das Arbeiten innerhalb ihrer eigenen Umgebung erfordern. MarathonMemBench läuft stattdessen als Plattform, auf der eine LLM-Persona über Stunden mit dem Agenten spricht, Fakten präsentiert, sie ändert und schließlich das Abrufen testet. Es erfordert lediglich, dass der Agent über eine Chat-Schnittstelle verfügt. Der Artikel skizziert Pläne für zukünftige Abschnitte, die bestehende Benchmarks, die Architektur der Plattform und Ergebnisse von Open-Source-Agenten behandeln, die überraschend stark waren.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten