ИсследованияМодели 🇷🇺 24.07.2026 15:02

RUMBA: новый бенчмарк для оценки долгосрочной памяти диалоговых систем на русском языке

СбербанкСбербанк
Представлен RUMBA (Russian User Memory Benchmark) — первый русскоязычный бенчмарк для оценки долгосрочной памяти в многосессионных диалогах. Он включает 85 диалогов и 1543 вопроса, проверяющих извлечение информации, рассуждение и умение воздерживаться от ответа. Бенчмарк учитывает временной контекст и позволяет диагностировать узкие места в архитектуре памяти.
RUMBA (Russian User Memory Benchmark) — новый русскоязычный бенчмарк для оценки долгосрочной памяти диалоговых систем, разработанный авторами статьи. Датасет содержит 85 оригинальных русскоязычных диалогов между пользователем и ассистентом, охватывающих в среднем 191 день общения (от 12 до 85 сессий, от 180 до 998 реплик). Всего в бенчмарке 1543 вопроса, каждый из которых имеет временную метку,
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
RAG = Retrieval-Augmented Generation — генерация с дополнением извлечением
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости