PesquisaModelos 🇷🇺 24.07.2026 15:02

RUMBA: Novo Referencial para Avaliar a Memória de Longo Prazo de Sistemas de Diálogo em Russo

СбербанкСбербанк
Um novo referencial em língua russa chamado RUMBA (Russian User Memory Benchmark) foi criado para avaliar a memória de longo prazo em diálogos de múltiplas sessões. Ele abrange três supergrupos: Extração de Informação, Raciocínio e Abstenção, com uma taxonomia detalhada que inclui tipo semântico, escopo da sessão e temporalidade.
O benchmark RUMBA foi desenvolvido para avaliar a memória de longo prazo de sistemas de diálogo em russo, suprindo a falta de tais benchmarks para o idioma. Consiste em 85 diálogos com 1.543 perguntas, com média de 191 dias de conversa e cerca de 340.000 caracteres por diálogo. O benchmark avalia três supergrupos: Extração de Informações (encontrar e atualizar fatos), Raciocínio (inferência de múltiplas etapas) e Abstenção (saber quando não responder). Cada pergunta é marcada com tipo semântico, escopo de sessão (única ou múltiplas sessões) e temporalidade (temporal ou atemporal), com tags adicionais de expressão temporal. Os diálogos foram criados do zero, com falas de usuário escritas por humanos e respostas do assistente geradas pelo GigaChat Max. O conjunto de dados inclui versões em russo e inglês para comparação interlinguística.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas