الأبحاثالنماذج 🇷🇺 24.07.2026 15:02

RUMBA: معيار جديد لتقييم الذاكرة طويلة المدى لأنظمة الحوار باللغة الروسية

СбербанкСбербанк
تم تقديم RUMBA (معيار ذاكرة المستخدم الروسي)، وهو أول معيار باللغة الروسية لتقييم الذاكرة طويلة المدى في الحوارات متعددة الجلسات. يتضمن 85 حوارًا و1,543 سؤالًا تختبر استرجاع المعلومات والاستدلال والقدرة على الامتناع عن الإجابة. يأخذ المعيار في الاعتبار السياق الزمني ويتيح تشخيص الاختناقات في بنية الذاكرة.
RUMBA (Russian User Memory Benchmark) — новый русскоязычный бенчмарк для оценки долгосрочной памяти диалоговых систем, разработанный авторами статьи. Датасет содержит 85 оригинальных русскоязычных диалогов между пользователем и ассистентом, охватывающих в среднем 191 день общения (от 12 до 85 сессий, от 180 до 998 реплик). Всего в бенчмарке 1543 вопроса, каждый из которых имеет временную метку, что позволяет проверять актуальность фактов на момент вопроса. Вопросы разделены на три супергруппы: Information Extraction (поиск и корректное использование фактов с учётом обновлений, удалений и временных зависимостей), Reasoning (рассуждение с сопоставлением, вычислениями, причинно-следственными связями и временным контекстом) и Abstention (умение признать отсутствие информации). Для каждого вопроса задаётся многослойная таксономия: семантический тип (17 типов, например StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), количество evidence-сессий (single- или multi-session), темпоральность (temporal или atemporal) и тип временного выражения (explicit, implicit, no temporal expression). Диалоги создавались вручную: реплики пользователя писали люди, ответы ассистента генерировались с помощью GigaChat Max, вопросы и эталонные ответы верифицировались вручную. В сборе участвовало 26 контрибьюторов, процесс занял 20 рабочих дней. Английская версия получена автоматическим переводом и выверена вручную для кросс-лингвального сравнения.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة