MarathonMemBench: معيار جديد لاختبار ذاكرة وكيل نموذج اللغة الكبير
Anthropic
MarathonMemBench هو نوع جديد من منصات المعايير التي تختبر الذاكرة طويلة المدى لوكلاء نماذج اللغة الكبيرة من خلال محادثات طبيعية ممتدة، دون الحاجة إلى تعديلات خاصة للوكيل. تم إنشاؤه لأن المعايير الحالية للذاكرة إما تتطلب تحميل حوارات مسجلة مسبقًا (خارج السياسة) أو تتطلب قدرات إضافية للوكيل مثل لقطات الحالة أو الوصول البرمجي للذاكرة. تم تصميم المنصة لتكون غير معتمدة على عميل محدد، وتتطلب فقط واجهة محادثة، وتسمح بتقييم قدرة الوكيل على تذكر الحقائق والحفاظ عليها عبر محادثات طويلة تتجاوز نافذة السياق.
تقدم المقالة منصة MarathonMemBench، وهي منصة لقياس أداء الذاكرة طويلة المدى لوكلاء نماذج اللغة الكبيرة. يرى المؤلف أن نافذة السياق المحدودة للنماذج القائمة على المحولات هي قيد أساسي، ويجب على الوكلاء استخدام أدوات ذاكرة خارجية، مثل الكتابة إلى ملفات، للتغلب على هذا القيد. تنتقد المقالة المعايير الحالية للذاكرة لأنها تتطلب تكييف الوكلاء بشكل خاص: فالمعايير خارج السياسة (مثل LoCoMo وLongMemEval وMemoryAgentBench وBEAM) تحمّل حوارات مسجلة مسبقًا، بينما المعايير داخل السياسة (مثل AMemGym وMEMPROBE وMemoryArena وSTATE-Bench وMemGym وClawMark) تتطلب لقطات حالة، أو وصولًا برمجيًا إلى الذاكرة، أو العمل داخل بيئتها الخاصة. بدلاً من ذلك، تعمل MarathonMemBench كمنصة حيث يتحدث شخصية نموذج لغة كبير مع الوكيل لساعات، وتقدم حقائق، وتغيرها، وتختبر أخيرًا الاسترجاع. لا تتطلب المنصة سوى أن يكون لدى الوكيل واجهة محادثة. تحدد المقالة خططًا لأقسام مستقبلية تغطي المعايير الحالية، وهندسة المنصة، ونتائج الوكلاء مفتوحي المصدر، والتي كانت قوية بشكل مدهش.
المصدر: Habr — хаб ИИ —
الأصلي
