研究モデル 🇷🇺 24.07.2026 15:02

RUMBA: A New Benchmark for Evaluating Long-term Memory of Dialogue Systems in Russian

СбербанкСбербанк
RUMBA (Russian User Memory Benchmark), the first Russian-language benchmark for evaluating long-term memory in multi-session dialogues, has been introduced. It includes 85 dialogues and 1,543 questions testing information retrieval, reasoning, and the ability to refrain from answering. The benchmark accounts for temporal context and enables diagnosis of bottlenecks in memory architecture.
RUMBA(Russian User Memory Benchmark)は、論文著者らが開発した、対話システムの長期記憶を評価するための新しいロシア語ベンチマークです。データセットには、ユーザーとアシスタント間の85件のオリジナルのロシア語対話が含まれており、平均191日間のコミュニケーション(12~85セッション、180~998発話)をカバーしています。ベンチマーク全体で1543の質問があり、各質問にはタイムスタンプが付与されており、質問時点での事実の最新性を確認できます。質問は3つのスーパーグループに分かれています。Information Extraction(更新、削除、時間的依存関係を考慮した事実の検索と正しい使用)、Reasoning(比較、計算、因果関係、時間的コンテキストを用いた推論)、Abstention(情報がないことを認識する能力)です。各質問には多層的な分類が与えられています。意味タイプ(StaticUser、UpdatingInfo、SocialRelationship、Arithmetic、MultiStepなどの17タイプ)、証拠となるセッション数(single-sessionまたはmulti-session)、時間性(temporalまたはatemporal)、時間表現のタイプ(explicit、implicit、no temporal expression)です。対話は手動で作成されました。ユーザーの発話は人間が書き、アシスタントの応答はGigaChat Maxを用いて生成され、質問と正解回答は手動で検証されました。収集には26名のコントリビューターが参加し、作業には20営業日を要しました。英語版は自動翻訳で作成され、言語横断的な比較のために手動で校正されました。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース