研究 🇷🇺 15.08.2026 04:02

构建诚实的RAG评估集:如何收集前100-300个案例而不自欺

MicrosoftMicrosoft
文章讨论了为RAG系统创建人工评估集的重要性,该评估集应与冒烟测试和训练数据分开。建议收集100-300个精选案例,覆盖多个场景,分别标注检索和答案生成,并使用Recall@k、MRR@k和nDCG@k等指标。合成数据和公共基准不足以用于特定领域的检索评估。
作者认为,像MTEB和BEIR这样的公开基准并不能保证在特定领域任务上具有良好的检索性能,而合成数据可能导致过于规整的表述。相反,他们建议构建一个包含100至300个案例的人工评估集,实际起步可为120个案例,这些案例来源于日志、文档、专家访谈以及经过审查的合成候选数据。每个案例应包括查询、场景、预期文档ID、黄金证据片段、预期事实、可回答性以及重要性说明等字段。评估集应划分为6至8个部分,涵盖精确实体、释义、长段落、表格、版本差异、无答案案例、措辞不当及敏感场景。检索和答案生成应分别评估,检索指标包括Recall@k、MRR@k和nDCG@k,答案指标包括基于事实性、完整性、答案相关性和正确弃权。作者强调,对于无答案部分,标准召回率没有意义,并建议设置单独的发布关卡。他们还警告不要使用训练数据中的案例,并建议在人工子集上验证使用大语言模型作为评审的可行性。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻