золотых запросов; Уровень 2 — качество извлечённого контекста для RAG (Contextual Precision и Recall); Уровень 3 — качество генерации RAG (Faithfulness, уровень галлюцинаций, релевантность ответов, полнота, точность цитирования); Уровень 4 — агентность и навигация по графам знаний (многошаговые переходы, корректность использования инструментов, завершение задач, следование плану); Уровень 5 — обработка неполных и слабо связанных данных (воздержание от ответа, чрезмерная экстраполяция, конфликт между устаревшими и актуальными данными). Для каждого уровня предлагаются рекомендуемые инструменты: pytest, Hypothesis, Postman, k6 для Уровня 0; ranx, trec_eval для Уровня 1; deepeval, RAGAS, TruLens для Уровней 2–4; пользовательский G-Eval для Уровня 5. Особый акцент сделан на необходимости последовательного тестирования — нет смысла оценивать метрики RAG, если поисковый движок не проходит базовые тесты, например, не находит документ из-за опечатки.