Чек-лист тестирования поисковых и RAG-систем: шесть уровней проверок

Представлен чек-лист для тестирования поисковых и RAG-систем, включающий шесть уровней проверок — от базовой функциональности до работы с неполными данными. Описаны метрики, инструменты и глоссарий из более чем 50 терминов. Подчёркивается важность последовательности уровней: не имеет смысла оценивать RAG, если не пройдён нулевой уровень.
На Хабре опубликован подробный чек-лист для тестирования поисковых систем и RAG-архитектур. Авторы выделяют шесть уровней проверок: Уровень 0 — функциональный (движок находит по указанным полям, исправляет опечатки, обрабатывает пустой запрос и спецсимволы); Уровень 1 — классический Information Retrieval с метриками Precision@k, Recall@k, NDCG, MRR, MAP на размеченном golden query set; Уровень 2
Показать ещё ↓
Сокращения
RAG = Retrieval-Augmented Generation — генерация с дополнением поиском
LLM = Large Language Model — большая языковая модель
NDCG = Normalized Discounted Cumulative Gain — нормированный дисконтированный кумулятивный выигрыш
MRR = Mean Reciprocal Rank — средняя обратная позиция первого правильного ответа
MAP = Mean Average Precision — средняя средняя точность
CI/CD = Continuous Integration / Continuous Deployment — непрерывная интеграция / непрерывное развёртывание
Источник: Habr — хаб NLP — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости