Lista de Verificação para Testes em Sistemas de Busca e RAG: Seis Níveis de Verificações
É apresentada uma lista de verificação para testar sistemas de busca e RAG, composta por seis níveis de verificações — desde funcionalidades básicas até o tratamento de dados incompletos. São descritas métricas, ferramentas e um glossário com mais de 50 termos. A importância da sequência dos níveis é enfatizada: não faz sentido avaliar RAG se o nível zero não foi ultrapassado.
No Habré foi publicado um checklist detalhado para testar sistemas de busca e arquiteturas RAG. Os autores destacam seis níveis de verificação: Nível 0 — funcional (o mecanismo encontra pelos campos especificados, corrige erros de digitação, lida com consulta vazia e caracteres especiais); Nível 1 — Information Retrieval clássico com métricas Precision@k, Recall@k, NDCG, MRR, MAP em um golden query set anotado; Nível 2 — qualidade do contexto encontrado para RAG (Precisão Contextual e Recall); Nível 3 — qualidade da geração RAG (Faithfulness, Taxa de Alucinação, Relevância da Resposta, Completude, precisão das citações); Nível 4 — agência e navegação por grafo de conhecimento (multi-hop, tool correctness, task completion, plan adherence); Nível 5 — trabalho com dados incompletos e fracamente relacionados (abstention, super extrapolação, conflito entre dados desatualizados e atuais). Para cada nível são fornecidas ferramentas recomendadas: pytest, Hypothesis, Postman, k6 para o Nível 0; ranx, trec_eval para o Nível 1; deepeval, RAGAS, TruLens para os Níveis 2 a 4; G-Eval personalizado para o Nível 5. Ênfase especial é dada ao fato de que as verificações devem ser realizadas sequencialmente — não faz sentido avaliar métricas de RAG se o motor de busca não passa nos testes básicos, por exemplo, não encontra um documento devido a um erro de digitação.
Fonte: Habr — хаб NLP —
original
