RUMBA: Neuer Benchmark zur Bewertung des Langzeitgedächtnisses von Dialogsystemen auf Russisch
Сбербанк
Ein neuer russischsprachiger Benchmark namens RUMBA (Russian User Memory Benchmark) wurde entwickelt, um das Langzeitgedächtnis in mehrsitzigen Dialogen zu bewerten. Er umfasst drei Supergruppen: Informationsextraktion, Reasoning und Enthaltung, mit einer detaillierten Taxonomie, die semantische Typ, Sitzungsumfang und Zeitlichkeit beinhaltet.
Der RUMBA-Benchmark wurde entwickelt, um das Langzeitgedächtnis von Dialogsystemen auf Russisch zu bewerten, da es für diese Sprache an entsprechenden Benchmarks mangelt. Er besteht aus 85 Dialogen mit 1.543 Fragen, die durchschnittlich 191 Tage Konversation und etwa 340.000 Zeichen pro Dialog umfassen. Der Benchmark bewertet drei Supergruppen: Informationsextraktion (Finden und Aktualisieren von Fakten), Schlussfolgern (mehrstufige Inferenz) und Enthaltung (Wissen, wann keine Antwort gegeben werden sollte). Jede Frage ist mit semantischem Typ, Sitzungsumfang (Einzel- oder Mehrfachsitzung) und Zeitlichkeit (temporal oder atemporal) versehen, zusätzlich mit Tags für temporale Ausdrücke. Die Dialoge wurden von Grund auf erstellt, wobei Benutzeräußerungen von Menschen verfasst und Assistentenantworten von GigaChat Max generiert wurden. Der Datensatz enthält russische und englische Versionen für einen sprachübergreifenden Vergleich.
Quelle: Habr — хаб ИИ —
Original
