搜索与RAG系统测试清单:六大检查层次
本文提出了一份针对搜索和RAG系统的测试清单,包含六个层次的检查——从基本功能到处理不完整数据。详细描述了评估指标、工具以及包含50多个术语的词汇表。强调了各层次顺序的重要性:如果连零级基础都未通过,评估RAG便毫无意义。
Habr опубликовал подробный чек-лист для тестирования поисковых систем и RAG-архитектур. Авторы выделяют шесть уровней проверок: Уровень 0 — функциональный (движок находит по указанным полям, исправляет опечатки, обрабатывает пустой запрос и спецсимволы); Уровень 1 — классический Information Retrieval с метриками Precision@k, Recall@k, Normalized Discounted Cumulative Gain (NDCG), Mean Reciprocal Rank (MRR), Mean Average Precision (MAP) на размеченном золотом наборе запросов; Уровень 2 — качество найденного контекста для RAG (Contextual Precision и Recall); Уровень 3 — качество генерации RAG (Faithfulness, Hallucination Rate, Answer Relevance, Completeness, точность цитирования); Уровень 4 — агентность и навигация по графу знаний (multi-hop, tool correctness, task completion, plan adherence); Уровень 5 — работа с неполными и слабосвязанными данными (abstention, переэкстраполяция, конфликт устаревших и актуальных данных). Для каждого уровня приведены рекомендуемые инструменты: pytest, Hypothesis, Postman, k6 для Уровня 0; ranx, trec_eval для Уровня 1; deepeval, RAGAS, TruLens для Уровней 2–4; кастомный G-Eval для Уровня 5. Особый акцент сделан на том, что проверки нужно проводить последовательно — нет смысла оценивать RAG-метрики, если поисковый движок не проходит базовые тесты, например, не находит документ из-за опечатки.
来源: Habr — хаб NLP —
原文
