Construire un ensemble d'évaluation RAG honnête : comment collecter les 100 à 300 premiers cas sans vous tromper
Microsoft
L'article discute de l'importance de créer un ensemble d'évaluation manuelle pour les systèmes RAG, distinct des tests de fumée et des données d'entraînement. Il propose de collecter 100 à 300 cas soigneusement sélectionnés dans plusieurs scénarios, en étiquetant séparément la récupération et la génération de réponses, et en utilisant des métriques comme Recall@k, MRR@k et nDCG@k. Les données synthétiques et les références publiques sont insuffisantes pour l'évaluation de la récupération spécifique au domaine.
L'auteur soutient que les benchmarks publics comme MTEB et BEIR ne garantissent pas une bonne récupération pour des tâches spécifiques à un domaine, et que les données synthétiques peuvent conduire à des formulations trop propres. Ils recommandent plutôt de construire un ensemble d'évaluation manuel de 100 à 300 cas, avec un démarrage pratique de 120 cas issus des journaux, de la documentation, d'entretiens avec des experts et de candidats synthétiques après examen. Chaque cas doit inclure des champs tels que la requête, le scénario, les identifiants de documents attendus, les extraits de preuve en or, les faits attendus, la possibilité de réponse et l'importance du cas. L'ensemble doit être divisé en 6 à 8 tranches couvrant les entités exactes, la paraphrase, les longues sections, les tableaux, les versions, les cas sans réponse, les formulations médiocres et les scénarios sensibles. La récupération et la génération de réponses doivent être évaluées séparément, avec des métriques de récupération incluant le rappel à k, le rang réciproque moyen à k et le gain cumulé actualisé normalisé à k, et des métriques de réponse incluant la fiabilité, la complétude, la pertinence de la réponse et l'abstention correcte. L'auteur souligne que pour les tranches sans réponse, le rappel standard n'a pas de sens et suggère un seuil de sortie distinct. Ils mettent également en garde contre l'utilisation de données d'entraînement dans l'ensemble d'évaluation et recommandent de valider l'utilisation d'un LLM comme juge sur un sous-ensemble manuel.
Source: Habr — хаб ИИ —
original
