RUMBA: Un Nuevo Benchmark para Evaluar la Memoria a Largo Plazo de Sistemas de Diálogo en Ruso
Сбербанк
Se ha presentado RUMBA (Russian User Memory Benchmark), el primer benchmark en lengua rusa para evaluar la memoria a largo plazo en diálogos de múltiples sesiones. Incluye 85 diálogos y 1,543 preguntas que evalúan recuperación de información, razonamiento y la capacidad de abstenerse de responder. El benchmark considera el contexto temporal y permite diagnosticar cuellos de botella en la arquitectura de la memoria.
RUMBA (Russian User Memory Benchmark) es un nuevo benchmark en ruso para evaluar la memoria a largo plazo de sistemas de diálogo, desarrollado por los autores del artículo. El conjunto de datos contiene 85 diálogos originales en ruso entre un usuario y un asistente, que abarcan un promedio de 191 días de conversación (de 12 a 85 sesiones, de 180 a 998 turnos de palabra). En total, el benchmark incluye 1543 preguntas, cada una con una marca de tiempo que permite verificar la actualidad de los hechos en el momento de la pregunta. Las preguntas se dividen en tres supergrupos: Information Extraction (búsqueda y uso correcto de hechos teniendo en cuenta actualizaciones, eliminaciones y dependencias temporales), Reasoning (razonamiento con comparaciones, cálculos, relaciones de causa y efecto y contexto temporal) y Abstention (capacidad de reconocer la falta de información). Para cada pregunta se define una taxonomía multicapa: tipo semántico (17 tipos, por ejemplo, StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), número de sesiones de evidencia (sesión única o múltiple), temporalidad (temporal o atemporal) y tipo de expresión temporal (explícita, implícita, sin expresión temporal). Los diálogos se crearon manualmente: los turnos del usuario fueron escritos por personas, las respuestas del asistente se generaron con GigaChat Max, y las preguntas y respuestas de referencia se verificaron manualmente. Participaron 26 contribuyentes y el proceso tomó 20 días laborables. La versión en inglés se obtuvo mediante traducción automática y se revisó manualmente para una comparación multilingüe.
Fuente: Habr — хаб ИИ —
original
