Lista de verificación para pruebas de sistemas de búsqueda y RAG: seis niveles de comprobaciones
Se presenta una lista de verificación para probar sistemas de búsqueda y RAG (Generación Aumentada por Recuperación), que abarca seis niveles de comprobaciones, desde la funcionalidad básica hasta el manejo de datos incompletos. Se describen métricas, herramientas y un glosario de más de 50 términos. Se enfatiza la importancia de la secuencia de niveles: no tiene sentido evaluar RAG si no se ha superado el nivel cero.
En Habr se ha publicado una lista de verificación detallada para probar motores de búsqueda y arquitecturas RAG. Los autores identifican seis niveles de verificación: Nivel 0 — funcional (el motor recupera por campos especificados, corrige errores tipográficos, maneja consultas vacías y caracteres especiales); Nivel 1 — Recuperación de Información clásica con métricas Precision@k, Recall@k, NDCG, MRR, MAP sobre un conjunto de consultas doradas etiquetadas; Nivel 2 — calidad del contexto recuperado para RAG (Precisión Contextual y Recall); Nivel 3 — calidad de la generación RAG (Fidelidad, Tasa de Alucinación, Relevancia de la Respuesta, Completitud, precisión de las citas); Nivel 4 — agencia y navegación a través de grafos de conocimiento (multi-salto, corrección de herramientas, finalización de tareas, adherencia al plan); Nivel 5 — manejo de datos incompletos y débilmente relacionados (abstención, sobreextrapolación, conflicto entre datos desactualizados y actuales). Para cada nivel, se proporcionan herramientas recomendadas: pytest, Hypothesis, Postman, k6 para el Nivel 0; ranx, trec_eval para el Nivel 1; deepeval, RAGAS, TruLens para los Niveles 2-4; G-Eval personalizado para el Nivel 5. Se hace especial hincapié en la necesidad de realizar pruebas secuenciales: no tiene sentido evaluar métricas RAG si el motor de búsqueda falla en pruebas básicas, como no encontrar un documento debido a un error tipográfico.
Fuente: Habr — хаб NLP —
original
