Pesquisa 🇷🇺 15.08.2026 04:02

Construindo um conjunto de avaliação RAG honesto: como coletar os primeiros 100-300 casos sem enganar a si mesmo

MicrosoftMicrosoft
O artigo discute a importância de criar um conjunto de avaliação manual para sistemas RAG, separado de testes de fumaça e dados de treinamento. Propõe coletar 100-300 casos cuidadosamente selecionados em vários cenários, rotulando recuperação e geração de respostas separadamente, e usando métricas como Recall@k, MRR@k e nDCG@k. Dados sintéticos e benchmarks públicos são insuficientes para avaliação de recuperação específica de domínio.
O autor argumenta que benchmarks públicos como MTEB e BEIR não garantem uma boa recuperação em tarefas específicas de domínio, e que dados sintéticos podem levar a formulações excessivamente limpas. Em vez disso, eles recomendam construir um conjunto de avaliação manual de 100-300 casos, com um início prático de 120 casos provenientes de logs, documentação, entrevistas com especialistas e candidatos sintéticos após revisão. Cada caso deve incluir campos como consulta, cenário, IDs de documentos esperados, trechos de evidência dourada, fatos esperados, possibilidade de resposta e por que isso importa. O conjunto deve ser dividido em 6-8 fatias cobrindo entidades exatas, paráfrases, seções longas, tabelas, versões, casos sem resposta, formulações pobres e cenários sensíveis. A recuperação e a geração de respostas devem ser avaliadas separadamente, com métricas de recuperação incluindo Recall@k, MRR@k e nDCG@k, e métricas de resposta incluindo fundamentação, completude, relevância da resposta e abstenção correta. O autor enfatiza que para fatias sem resposta, o recall padrão é sem sentido e sugere um portão de liberação separado. Eles também alertam contra o uso de dados de treinamento no conjunto de avaliação e sugerem validar o LLM-como-juiz em um subconjunto manual.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas