ApplicationsRecherche 🇷🇺 27.07.2026 09:05

Checklist de test pour les systèmes de recherche et RAG : six niveaux de vérifications

Une checklist pour tester les systèmes de recherche et RAG (Retrieval-Augmented Generation) est présentée, comprenant six niveaux de vérifications, allant des fonctionnalités de base à la gestion des données incomplètes. Des métriques, des outils et un glossaire de plus de 50 termes sont décrits. L'importance de la séquence des niveaux est soulignée : il n'y a pas de sens à évaluer le RAG si le niveau zéro n'a pas été franchi.
На Хабре опубликован подробный чек-лист для тестирования поисковых систем и RAG-архитектур. Авторы выделяют шесть уровней проверок: Уровень 0 — функциональный (движок находит по указанным полям, исправляет опечатки, обрабатывает пустой запрос и спецсимволы); Уровень 1 — классический Information Retrieval с метриками Precision@k, Recall@k, NDCG, MRR, MAP на размеченном golden query set; Уровень 2 — качество найденного контекста для RAG (Contextual Precision и Recall); Уровень 3 — качество генерации RAG (Faithfulness, Hallucination Rate, Answer Relevance, Completeness, точность цитирования); Уровень 4 — агентность и навигация по графу знаний (multi-hop, tool correctness, task completion, plan adherence); Уровень 5 — работа с неполными и слабосвязанными данными (abstention, переэкстраполяция, конфликт устаревших и актуальных данных). Для каждого уровня приведены рекомендуемые инструменты: pytest, Hypothesis, Postman, k6 для Уровня 0; ranx, trec_eval для Уровня 1; deepeval, RAGAS, TruLens для Уровней 2-4; кастомный G-Eval для Уровня 5. Особый акцент сделан на том, что проверки нужно проводить последовательно — нет смысла оценивать RAG-метрики, если поисковый движок не проходит базовые тесты, например, не находит документ из-за опечатки.
Source: Habr — хаб NLP — original
Nos articles précédents sur ce sujet ↓
Infos fraîches