Lista de Verificación para Pruebas de Sistemas de Búsqueda y RAG: Seis Niveles de Control
Se presenta una lista de verificación para probar sistemas de búsqueda y RAG, que comprende seis niveles de control, desde la funcionalidad básica hasta el manejo de datos incompletos. Se describen métricas, herramientas y un glosario de más de 50 términos. Se enfatiza la importancia de la secuencia de niveles: no tiene sentido evaluar RAG si no se ha superado el nivel cero.
En Habr se ha publicado un checklist detallado para probar motores de búsqueda y arquitecturas RAG. Los autores distinguen seis niveles de verificación: Nivel 0 — funcional (el motor encuentra por campos especificados, corrige errores tipográficos, procesa consultas vacías y caracteres especiales); Nivel 1 — Recuperación de Información clásico con métricas Precision@k, Recall@k, NDCG, MRR, MAP en un golden query set etiquetado; Nivel 2 — calidad del contexto encontrado para RAG (Precisión y Recall Contextual); Nivel 3 — calidad de la generación RAG (Fidelidad, Tasa de Alucinación, Relevancia de la Respuesta, Integridad, precisión de citas); Nivel 4 — agentividad y navegación por el grafo de conocimiento (multi-hop, corrección de herramientas, finalización de tareas, adherencia al plan); Nivel 5 — trabajo con datos incompletos y débilmente relacionados (abstención, sobreextrapolación, conflicto entre datos obsoletos y actuales). Para cada nivel se proporcionan herramientas recomendadas: pytest, Hypothesis, Postman, k6 para el Nivel 0; ranx, trec_eval para el Nivel 1; deepeval, RAGAS, TruLens para los Niveles 2–4; G-Eval personalizado para el Nivel 5. Se hace especial hincapié en que las pruebas deben realizarse de forma secuencial — no tiene sentido evaluar métricas RAG si el motor de búsqueda no supera pruebas básicas, por ejemplo, no encuentra un documento debido a un error tipográfico.
Fuente: Habr — хаб NLP —
original
