MarathonMemBench: Tolok Ukur Baru untuk Menguji Memori Agen LLM Anda
Anthropic
MarathonMemBench adalah platform tolok ukur jenis baru yang menguji memori jangka panjang agen LLM melalui percakapan alami yang panjang, tanpa memerlukan modifikasi khusus pada agen. Platform ini dibuat karena tolok ukur memori yang ada saat ini mengharuskan memuat dialog yang direkam sebelumnya (off-policy) atau menuntut kemampuan agen tambahan seperti snapshot status atau akses memori terprogram. Platform ini dirancang agnostik terhadap agen, hanya memerlukan antarmuka obrolan, dan memungkinkan evaluasi kemampuan agen untuk mengingat dan mempertahankan fakta dalam percakapan panjang yang melebihi jendela konteks.
Artikel ini memperkenalkan MarathonMemBench, sebuah platform untuk menguji memori jangka panjang dari agen LLM. Penulis berargumen bahwa konteks jendela terbatas dari model berbasis transformer adalah keterbatasan mendasar, dan agen harus menggunakan alat memori eksternal, seperti menulis ke file, untuk mengatasinya. Tolok ukur memori yang ada dikritik karena mengharuskan agen untuk diadaptasi secara khusus: tolok ukur off-policy (misalnya, LoCoMo, LongMemEval, MemoryAgentBench, BEAM) memuat dialog yang telah direkam sebelumnya, sementara tolok ukur on-policy (misalnya, AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) menuntut snapshot status, akses memori terprogram, atau beroperasi di lingkungan mereka sendiri. MarathonMemBench berjalan sebagai platform di mana persona LLM berbicara dengan agen selama berjam-jam, menyajikan fakta, mengubahnya, dan akhirnya menguji ingatan. Platform ini hanya memerlukan agen untuk memiliki antarmuka obrolan. Artikel ini menguraikan rencana untuk bagian di masa depan yang mencakup tolok ukur yang ada, arsitektur platform, dan hasil dari agen sumber terbuka, yang ternyata sangat kuat.
Sumber: Habr — хаб ИИ —
asli
