RUMBA: Ein neuer Benchmark zur Bewertung des Langzeitgedächtnisses von Dialogsystemen auf Russisch
Сбербанк
RUMBA (Russian User Memory Benchmark), der erste russischsprachige Benchmark zur Bewertung des Langzeitgedächtnisses in multisession-Dialogen, wurde vorgestellt. Er umfasst 85 Dialoge und 1.543 Fragen, die Informationsabruf, logisches Denken und die Fähigkeit, Antworten zu verweigern, testen. Der Benchmark berücksichtigt den zeitlichen Kontext und ermöglicht die Diagnose von Engpässen in der Gedächtnisarchitektur.
RUMBA (Russian User Memory Benchmark) — новый русскоязычный бенчмарк для оценки долгосрочной памяти диалоговых систем, разработанный авторами статьи. Датасет содержит 85 оригинальных русскоязычных диалогов между пользователем и ассистентом, охватывающих в среднем 191 день общения (от 12 до 85 сессий, от 180 до 998 реплик). Всего в бенчмарке 1543 вопроса, каждый из которых имеет временную метку, что позволяет проверять актуальность фактов на момент вопроса. Вопросы разделены на три супергруппы: Information Extraction (поиск и корректное использование фактов с учётом обновлений, удалений и временных зависимостей), Reasoning (рассуждение с сопоставлением, вычислениями, причинно-следственными связями и временным контекстом) и Abstention (умение признать отсутствие информации). Для каждого вопроса задаётся многослойная таксономия: семантический тип (17 типов, например StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), количество evidence-сессий (single- или multi-session), темпоральность (temporal или atemporal) и тип временного выражения (explicit, implicit, no temporal expression). Диалоги создавались вручную: реплики пользователя писали люди, ответы ассистента генерировались с помощью GigaChat Max, вопросы и эталонные ответы верифицировались вручную. В сборе участвовало 26 контрибьюторов, процесс занял 20 рабочих дней. Английская версия получена автоматическим переводом и выверена вручную для кросс-лингвального сравнения.
Quelle: Habr — хаб ИИ —
Original
