RUMBA: Een nieuwe benchmark voor het evalueren van langetermijngeheugen van dialoogsystemen in het Russisch
Сбербанк
RUMBA (Russian User Memory Benchmark), de eerste Russischtalige benchmark voor het evalueren van langetermijngeheugen in multi-sessiedialogen, is geïntroduceerd. Het omvat 85 dialogen en 1.543 vragen die informatieopvraging, redeneren en het vermogen om antwoorden te weigeren testen. De benchmark houdt rekening met temporele context en maakt diagnose van knelpunten in de geheugenarchitectuur mogelijk.
RUMBA (Russian User Memory Benchmark) is een nieuwe Russischtalige benchmark voor het evalueren van het langetermijngeheugen van dialoogsystemen, ontwikkeld door de auteurs van het artikel. De dataset bevat 85 originele Russischtalige dialogen tussen gebruiker en assistent, die gemiddeld 191 dagen aan interactie beslaan (van 12 tot 85 sessies, met 180 tot 998 beurten). In totaal bevat de benchmark 1543 vragen, elk voorzien van een tijdstempel, waardoor de actualiteit van feiten op het moment van de vraag kan worden getoetst. De vragen zijn onderverdeeld in drie supergroepen: Information Extraction (het vinden en correct gebruiken van feiten, rekening houdend met updates, verwijderingen en temporele afhankelijkheden), Reasoning (redeneren met vergelijkingen, berekeningen, oorzaak-gevolgrelaties en temporele context) en Abstention (het vermogen om te erkennen dat informatie ontbreekt). Voor elke vraag wordt een gelaagde taxonomie gehanteerd: semantisch type (17 typen, zoals StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), aantal evidence-sessies (single- of multi-session), temporaliteit (temporal of atemporal) en type temporele uitdrukking (expliciet, impliciet, geen temporele uitdrukking). De dialogen zijn handmatig gecreëerd: gebruikersbeurten zijn door mensen geschreven, assistentantwoorden gegenereerd met behulp van GigaChat Max, en vragen en referentieantwoorden zijn handmatig geverifieerd. Aan de totstandkoming hebben 26 medewerkers deelgenomen; het proces duurde 20 werkdagen. De Engelse versie is verkregen via automatische vertaling en handmatig gecorrigeerd voor cross-linguale vergelijking.
Bron: Habr — хаб ИИ —
origineel
