InvestigaciónModelos 🇷🇺 24.07.2026 15:02

RUMBA: nuevo punto de referencia para evaluar la memoria a largo plazo de sistemas de diálogo en ruso

СбербанкСбербанк
Se ha creado un nuevo punto de referencia en ruso llamado RUMBA (Russian User Memory Benchmark) para evaluar la memoria a largo plazo en diálogos de múltiples sesiones. Cubre tres supergrupos: extracción de información, razonamiento y abstención, con una taxonomía detallada que incluye tipo semántico, alcance de la sesión y temporalidad.
El benchmark RUMBA fue desarrollado para evaluar la memoria a largo plazo de los sistemas de diálogo en ruso, abordando la falta de dichos benchmarks para el idioma. Consta de 85 diálogos con 1543 preguntas, con un promedio de 191 días de conversación y aproximadamente 340 000 caracteres por diálogo. El benchmark evalúa tres supergrupos: Extracción de Información (encontrar y actualizar hechos), Razonamiento (inferencia de múltiples pasos) y Abstención (saber cuándo no responder). Cada pregunta está etiquetada con tipo semántico, alcance de sesión (una o varias sesiones) y temporalidad (temporal o atemporal), con etiquetas adicionales de expresiones temporales. Los diálogos se crearon desde cero, con frases de usuario escritas por humanos y respuestas del asistente generadas por GigaChat Max. El conjunto de datos incluye versiones en ruso e inglés para comparación interlingüística.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas