RisetModel 🇷🇺 24.07.2026 15:02

RUMBA: Tolok Ukur Baru untuk Mengevaluasi Memori Jangka Panjang Sistem Dialog dalam Bahasa Rusia

СбербанкСбербанк
Sebuah tolok ukur baru berbahasa Rusia bernama RUMBA (Russian User Memory Benchmark) telah dibuat untuk mengevaluasi memori jangka panjang dalam dialog multi-sesi. Tolok ukur ini mencakup tiga supergrup: Ekstraksi Informasi, Penalaran, dan Abstention, dengan taksonomi rinci yang mencakup tipe semantik, cakupan sesi, dan temporalitas.
Tolok ukur RUMBA dikembangkan untuk menilai memori jangka panjang sistem dialog dalam bahasa Rusia, mengatasi kurangnya tolok ukur serupa untuk bahasa tersebut. Tolok ukur ini terdiri dari 85 dialog dengan 1.543 pertanyaan, rata-rata 191 hari percakapan dan sekitar 340.000 karakter per dialog. Tolok ukur ini mengevaluasi tiga supergrup: Ekstraksi Informasi (menemukan dan memperbarui fakta), Penalaran (inferensi multi-langkah), dan Abstensi (mengetahui kapan tidak menjawab). Setiap pertanyaan diberi tag dengan tipe semantik, cakupan sesi (sesi tunggal atau multi-sesi), dan temporalitas (temporal atau atemporal), dengan tag ekspresi temporal tambahan. Dialog dibuat dari awal, dengan ucapan pengguna ditulis oleh manusia dan respons asisten dihasilkan oleh GigaChat Max. Kumpulan data ini mencakup versi bahasa Rusia dan Inggris untuk perbandingan lintas bahasa.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru