构建诚实的RAG评估集:如何收集首批100-300个案例而不自欺
Microsoft
本文讨论了为RAG系统创建手动评估集的重要性,该评估集应独立于冒烟测试和训练数据。它建议在多个场景中收集100-300个精心挑选的案例,分别标注检索和答案生成,并使用Recall@k、MRR@k和nDCG@k等指标。对于特定领域的检索评估,合成数据和公开基准是不够的。
著者は、MTEBやBEIRのような公開ベンチマークが、ドメイン固有のタスクにおける優れた検索を保証するものではなく、合成データは過度に整然とした定式化につながる可能性があると主張している。その代わりに、100〜300件の手動評価セットを構築することを推奨しており、実用的な開始点として、ログ、ドキュメント、専門家へのインタビュー、およびレビュー後の合成候補から得た120件を挙げている。各ケースには、クエリ、シナリオ、期待されるドキュメントID、ゴールドの根拠スパン、期待される事実、回答可能性、そしてそれが重要な理由などのフィールドを含めるべきである。セットは、完全一致エンティティ、言い換え、長いセクション、テーブル、バージョン、回答なしケース、不適切な表現、機密シナリオをカバーする6〜8のスライスに分割する必要がある。検索と回答生成は別々に評価すべきであり、検索メトリクスにはRecall@k、MRR@k、nDCG@kが含まれ、回答メトリクスには根拠性、完全性、回答関連性、および正しい棄権が含まれる。著者は、回答なしスライスでは標準的な再現率は無意味であることを強調し、別のリリースゲートを提案している。また、評価セットにトレーニングデータを使用することに対して警告し、手動サブセットでLLM-as-a-judgeを検証することを示唆している。
出典: Habr — хаб ИИ —
原文
