RechercheModèles 🇷🇺 24.07.2026 15:02

RUMBA : un nouveau benchmark pour évaluer la mémoire à long terme des systèmes de dialogue en russe

СбербанкСбербанк
RUMBA (Russian User Memory Benchmark), le premier benchmark en langue russe pour évaluer la mémoire à long terme dans les dialogues multi-sessions, a été introduit. Il comprend 85 dialogues et 1 543 questions testant la récupération d'informations, le raisonnement et la capacité à s'abstenir de répondre. Le benchmark prend en compte le contexte temporel et permet de diagnostiquer les goulots d'étranglement dans l'architecture mémoire.
RUMBA (Russian User Memory Benchmark) est un nouveau benchmark russophone pour évaluer la mémoire à long terme des systèmes dialogiques, développé par les auteurs de l'article. L'ensemble de données contient 85 dialogues originaux en russe entre un utilisateur et un assistant, couvrant en moyenne 191 jours de conversation (de 12 à 85 sessions, de 180 à 998 tours de parole). Au total, le benchmark compte 1543 questions, chacune étant associée à un horodatage, ce qui permet de vérifier la pertinence des faits au moment de la question. Les questions sont réparties en trois super-groupes : Information Extraction (recherche et utilisation correcte des faits en tenant compte des mises à jour, des suppressions et des dépendances temporelles), Reasoning (raisonnement avec comparaison, calculs, relations de cause à effet et contexte temporel) et Abstention (capacité à reconnaître l'absence d'information). Pour chaque question, une taxonomie multicouche est définie : le type sémantique (17 types, par exemple StaticUser, UpdatingInfo, SocialRelationship, Arithmetic, MultiStep), le nombre de sessions de preuve (single-session ou multi-session), la temporalité (temporelle ou atemporelle) et le type d'expression temporelle (explicite, implicite, aucune expression temporelle). Les dialogues ont été créés manuellement : les tours de l'utilisateur ont été rédigés par des humains, les réponses de l'assistant ont été générées à l'aide de GigaChat Max, et les questions ainsi que les réponses de référence ont été vérifiées manuellement. Vingt-six contributeurs ont participé à la collecte, et le processus a duré 20 jours ouvrables. La version anglaise a été obtenue par traduction automatique et révisée manuellement pour une comparaison cross-lingue.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches