RUMBA: Nieuwe benchmark voor evaluatie van langetermijngeheugen van dialoogsystemen in het Russisch
Сбербанк
Er is een nieuwe Russischtalige benchmark gecreëerd, genaamd RUMBA (Russian User Memory Benchmark), om het langetermijngeheugen in multi-sessie dialogen te evalueren. Deze benchmark omvat drie supergroepen: informatie-extractie, redeneren en onthouding, met een gedetailleerde taxonomie die semantisch type, sessieomvang en temporaliteit omvat.
De RUMBA-benchmark is ontwikkeld om het langetermijngeheugen van dialoogsystemen in het Russisch te evalueren, en vult daarmee het gebrek aan dergelijke benchmarks voor deze taal aan. Het bestaat uit 85 dialogen met 1.543 vragen, met gemiddeld 191 dagen aan conversatie en ongeveer 340.000 tekens per dialoog. De benchmark evalueert drie supergroepen: Informatie-extractie (het vinden en bijwerken van feiten), Redeneren (meerstapsinferentie) en Onthouding (weten wanneer niet te antwoorden). Elke vraag is getagd met een semantisch type, sessiebereik (enkele of meerdere sessies) en temporale aard (tijdelijk of niet-tijdelijk), met extra tags voor temporale uitdrukkingen. Dialogen zijn vanaf nul gecreëerd, waarbij gebruikersuitingen door mensen zijn geschreven en assistentreacties door GigaChat Max zijn gegenereerd. De dataset bevat Russische en Engelse versies voor cross-linguale vergelijking.
Bron: Habr — хаб ИИ —
origineel
