Investigación 🇷🇺 15.08.2026 04:02

Cómo construir un conjunto de evaluación RAG honesto: recopilar los primeros 100-300 casos sin engañarse a uno mismo

MicrosoftMicrosoft
El artículo discute la importancia de crear un conjunto de evaluación manual para sistemas RAG, separado de las pruebas de humo y los datos de entrenamiento. Propone recopilar de 100 a 300 casos cuidadosamente seleccionados en varios escenarios, etiquetando por separado la recuperación y la generación de respuestas, y utilizando métricas como Recall@k, MRR@k y nDCG@k. Los datos sintéticos y los puntos de referencia públicos son insuficientes para la evaluación de la recuperación específica de un dominio.
El autor sostiene que los benchmarks públicos como MTEB y BEIR no garantizan un buen rendimiento de recuperación en tareas específicas de un dominio, y que los datos sintéticos pueden dar lugar a formulaciones excesivamente pulidas. En lugar de ello, recomienda construir un conjunto de evaluación manual de 100 a 300 casos, con un inicio práctico de 120 casos extraídos de registros, documentación, entrevistas con expertos y candidatos sintéticos tras su revisión. Cada caso debe incluir campos como la consulta, el escenario, los ID de documentos esperados, los fragmentos de evidencia dorados, los hechos esperados, la capacidad de respuesta y por qué es importante. El conjunto debe dividirse en 6 a 8 segmentos que cubran entidades exactas, paráfrasis, secciones largas, tablas, versiones, casos sin respuesta, redacción deficiente y escenarios sensibles. La recuperación y la generación de respuestas deben evaluarse por separado, con métricas de recuperación que incluyan Recall@k, MRR@k y nDCG@k, y métricas de respuesta que incluyan fundamentación, completitud, relevancia de la respuesta y abstención correcta. El autor enfatiza que, para los segmentos sin respuesta, el recall estándar no es significativo y sugiere un umbral de lanzamiento separado. También advierte sobre el uso de datos de entrenamiento en el conjunto de evaluación y sugiere validar el LLM como juez en un subconjunto manual.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas