AplicaçõesPesquisa 🇷🇺 27.07.2026 09:05

Checklist de Testes para Sistemas de Busca e RAG: Seis Níveis de Verificações

Um checklist para testar sistemas de busca e RAG (Geração Aumentada por Recuperação) é apresentado, abrangendo seis níveis de verificações — desde funcionalidades básicas até o tratamento de dados incompletos. Métricas, ferramentas e um glossário com mais de 50 termos são descritos. A importância da sequência dos níveis é enfatizada: não adianta avaliar o RAG se o nível zero não foi ultrapassado.
Um checklist detalhado para testar motores de busca e arquiteturas RAG foi publicado no Habr. Os autores identificam seis níveis de verificação: Nível 0 — funcional (o motor recupera por campos especificados, corrige erros de digitação, lida com consultas vazias e caracteres especiais); Nível 1 — Recuperação de Informação clássica com métricas Precision@k, Recall@k, NDCG, MRR, MAP em um conjunto dourado de consultas rotuladas; Nível 2 — qualidade do contexto recuperado para RAG (Precisão Contextual e Recall); Nível 3 — qualidade da geração RAG (Fidelidade, Taxa de Alucinação, Relevância da Resposta, Completude, precisão das citações); Nível 4 — agência e navegação por grafos de conhecimento (multi-saltos, correção de ferramentas, conclusão de tarefas, adesão ao plano); Nível 5 — tratamento de dados incompletos e vagamente relacionados (abstenção, superextrapolação, conflito entre dados desatualizados e atuais). Para cada nível, são fornecidas ferramentas recomendadas: pytest, Hypothesis, Postman, k6 para o Nível 0; ranx, trec_eval para o Nível 1; deepeval, RAGAS, TruLens para os Níveis 2–4; G-Eval personalizado para o Nível 5. Ênfase especial é dada à necessidade de testagem sequencial — não faz sentido avaliar métricas de RAG se o motor de busca falha em testes básicos, como não encontrar um documento devido a um erro de digitação.
Fonte: Habr — хаб NLP — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas