RisetModel 🇷🇺 24.07.2026 15:02

RUMBA: A New Benchmark for Evaluating Long-term Memory of Dialogue Systems in Russian

СбербанкСбербанк
RUMBA (Russian User Memory Benchmark), the first Russian-language benchmark for evaluating long-term memory in multi-session dialogues, has been introduced. It includes 85 dialogues and 1,543 questions testing information retrieval, reasoning, and the ability to refrain from answering. The benchmark accounts for temporal context and enables diagnosis of bottlenecks in memory architecture.
RUMBA (Russian User Memory Benchmark) — sebuah tolok ukur baru berbahasa Rusia untuk mengevaluasi memori jangka panjang sistem dialog, yang dikembangkan oleh penulis artikel. Dataset ini berisi 85 dialog asli berbahasa Rusia antara pengguna dan asisten, yang mencakup rata-rata 191 hari komunikasi (dari 12 hingga 85 sesi, dari 180 hingga 998 ucapan). Total ada 1543 pertanyaan dalam tolok ukur ini, masing-masing memiliki cap waktu, yang memungkinkan verifikasi relevansi fakta pada saat pertanyaan diajukan. Pertanyaan-pertanyaan dibagi menjadi tiga supergrup: Information Extraction (pencarian dan penggunaan fakta yang benar dengan mempertimbangkan pembaruan, penghapusan, dan ketergantungan waktu), Reasoning (penalaran dengan perbandingan, kalkulasi, hubungan sebab-akibat, dan konteks waktu), dan Abstention (kemampuan untuk mengakui tidak adanya informasi). Untuk setiap pertanyaan, diberikan taksonomi berlapis: tipe semantik (17 tipe, misalnya StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), jumlah sesi bukti (sesi tunggal atau multi-sesi), temporalitas (temporal atau atemporal), dan tipe ekspresi waktu (eksplisit, implisit, tanpa ekspresi waktu). Dialog dibuat secara manual: ucapan pengguna ditulis oleh manusia, respons asisten dihasilkan menggunakan GigaChat Max, pertanyaan dan jawaban referensi diverifikasi secara manual. Sebanyak 26 kontributor berpartisipasi dalam pengumpulan, prosesnya memakan waktu 20 hari kerja. Versi bahasa Inggris diperoleh melalui terjemahan otomatis dan diperiksa secara manual untuk perbandingan lintas bahasa.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru