RUMBA: Um Novo Benchmark para Avaliar a Memória de Longo Prazo de Sistemas de Diálogo em Russo
Сбербанк
RUMBA (Russian User Memory Benchmark), o primeiro benchmark em língua russa para avaliar a memória de longo prazo em diálogos de múltiplas sessões, foi introduzido. Ele inclui 85 diálogos e 1.543 questões que testam recuperação de informação, raciocínio e a capacidade de se abster de responder. O benchmark leva em conta o contexto temporal e permite diagnosticar gargalos na arquitetura de memória.
RUMBA (Russian User Memory Benchmark) — новый русскоязычный бенчмарк для оценки долгосрочной памяти диалоговых систем, разработанный авторами статьи. Датасет содержит 85 оригинальных русскоязычных диалогов между пользователем и ассистентом, охватывающих в среднем 191 день общения (от 12 до 85 сессий, от 180 до 998 реплик). Всего в бенчмарке 1543 вопроса, каждый из которых имеет временную метку, что позволяет проверять актуальность фактов на момент вопроса. Вопросы разделены на три супергруппы: Information Extraction (поиск и корректное использование фактов с учётом обновлений, удалений и временных зависимостей), Reasoning (рассуждение с сопоставлением, вычислениями, причинно-следственными связями и временным контекстом) и Abstention (умение признать отсутствие информации). Для каждого вопроса задаётся многослойная таксономия: семантический тип (17 типов, например StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), количество evidence-сессий (single- или multi-session), темпоральность (temporal или atemporal) и тип временного выражения (explicit, implicit, no temporal expression). Диалоги создавались вручную: реплики пользователя писали люди, ответы ассистента генерировались с помощью GigaChat Max, вопросы и эталонные ответы верифицировались вручную. В сборе участвовало 26 контрибьюторов, процесс занял 20 рабочих дней. Английская версия получена автоматическим переводом и выверена вручную для кросс-лингвального сравнения.
Fonte: Habr — хаб ИИ —
original
