AjanlarAraştırma 🇷🇺 05.08.2026 14:02

MarathonMemBench: Bellek Testi İçin Yeni Bir Kıyaslama Platformu

AnthropicAnthropic
MarathonMemBench, LLM ajanlarının uzun süreli belleğini, özel ajan modifikasyonlarına gerek kalmadan genişletilmiş doğal konuşmalar yoluyla test eden yeni bir kıyaslama platformudur. Mevcut bellek kıyaslamaları ya önceden kaydedilmiş diyalogları yüklemeyi (off-policy) gerektirdiği ya da durum anlık görüntüleri veya programatik bellek erişimi gibi ek ajan yetenekleri talep ettiği için oluşturulmuştur. Platform, ajan-agnostik olacak şekilde tasarlanmıştır; yalnızca bir sohbet arayüzü gerektirir ve bağlam penceresini aşan uzun konuşmalar boyunca bir ajanın gerçekleri hatırlama ve sürdürme yeteneğinin değerlendirilmesine olanak tanır.
Makale, LLM ajanlarının uzun vadeli hafızasını ölçmek için bir platform olan MarathonMemBench'i tanıtıyor. Yazar, dönüştürücü tabanlı modellerin sınırlı bağlam penceresinin temel bir sınırlama olduğunu ve ajanların dosyalara yazma gibi harici hafıza araçlarını kullanarak bunun üstesinden gelmeleri gerektiğini savunuyor. Mevcut hafıza kıyaslamaları, ajanların özel olarak uyarlanmasını gerektirdiği için eleştiriliyor: politika dışı kıyaslamalar (örneğin LoCoMo, LongMemEval, MemoryAgentBench, BEAM) kayıtlı diyalogları yüklerken, politika içi olanlar (örneğin AMemGym, MEMPROBE, MemoryArena, STATE-Bench, MemGym, ClawMark) durum anlık görüntüleri, programatik hafıza erişimi veya kendi ortamlarında çalışmayı talep ediyor. MarathonMemBench bunun yerine, bir LLM kişiliğinin saatler boyunca ajanla sohbet ettiği, gerçekleri sunduğu, değiştirdiği ve sonunda hatırlamayı test ettiği bir platform olarak çalışıyor. Yalnızca ajanın bir sohbet arayüzüne sahip olmasını gerektiriyor. Makale, mevcut kıyaslamaları, platformun mimarisini ve şaşırtıcı derecede güçlü olan açık kaynak ajanlarından elde edilen sonuçları kapsayan gelecekteki bölümler için planları özetliyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler