RUMBA: новый бенчмарк для оценки долговременной памяти диалоговых систем на русском языке
Сбербанк
Создан новый русскоязычный бенчмарк RUMBA (Russian User Memory Benchmark) для оценки долговременной памяти в многосессионных диалогах. Он охватывает три супергруппы: извлечение информации, рассуждение и отказ от ответа, с детальной таксономией, включающей семантический тип, охват сессии и темпоральность.
Бенчмарк RUMBA был разработан для оценки долговременной памяти диалоговых систем на русском языке, восполняя отсутствие таких тестов для этого языка. Он состоит из 85 диалогов, содержащих 1 543 вопроса, со средней продолжительностью разговора 191 день и примерно 340 000 символов на диалог. Бенчмарк оценивает три супергруппы: извлечение информации (поиск и обновление фактов), рассуждение
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
