RechercheModèles 🇷🇺 24.07.2026 15:02

RUMBA : Un nouveau benchmark pour évaluer la mémoire à long terme des systèmes de dialogue en russe

СбербанкСбербанк
Un nouveau benchmark en langue russe appelé RUMBA (Russian User Memory Benchmark) a été créé pour évaluer la mémoire à long terme dans les dialogues multi-sessions. Il couvre trois super-groupes : Extraction d'informations, Raisonnement et Abstention, avec une taxonomie détaillée incluant le type sémantique, la portée de la session et la temporalité.
Le benchmark RUMBA a été développé pour évaluer la mémoire à long terme des systèmes de dialogue en russe, comblant ainsi le manque de tels benchmarks pour cette langue. Il se compose de 85 dialogues avec 1 543 questions, avec une moyenne de 191 jours de conversation et environ 340 000 caractères par dialogue. Le benchmark évalue trois supergroupes : l'extraction d'informations (trouver et mettre à jour des faits), le raisonnement (inférence en plusieurs étapes) et l'abstention (savoir quand ne pas répondre). Chaque question est étiquetée avec un type sémantique, une portée de session (session unique ou multi-session) et une temporalité (temporelle ou atemporelle), avec des étiquettes supplémentaires d'expression temporelle. Les dialogues ont été créés de toutes pièces, les énoncés des utilisateurs étant rédigés par des humains et les réponses de l'assistant générées par GigaChat Max. Le jeu de données comprend des versions en russe et en anglais pour une comparaison interlingue.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches