ИсследованияМодели 🇷🇺 24.07.2026 15:02

RUMBA: новый бенчмарк для оценки долговременной памяти диалоговых систем на русском языке

СбербанкСбербанк
Создан новый русскоязычный бенчмарк RUMBA (Russian User Memory Benchmark) для оценки долговременной памяти в многосессионных диалогах. Он охватывает три супергруппы: извлечение информации, рассуждение и отказ от ответа, с детальной таксономией, включающей семантический тип, охват сессии и темпоральность.
Бенчмарк RUMBA был разработан для оценки долговременной памяти диалоговых систем на русском языке, восполняя отсутствие таких тестов для этого языка. Он состоит из 85 диалогов, содержащих 1 543 вопроса, со средней продолжительностью разговора 191 день и примерно 340 000 символов на диалог. Бенчмарк оценивает три супергруппы: извлечение информации (поиск и обновление фактов), рассуждение
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости