Чек-лист тестирования поисковых и RAG-систем: шесть уровней проверок
Представлен чек-лист для тестирования поисковых и RAG-систем, включающий шесть уровней проверок — от базовой функциональности до работы с неполными данными. Описаны метрики, инструменты и глоссарий из более чем 50 терминов. Подчёркивается важность последовательности уровней: не имеет смысла оценивать RAG, если не пройдён нулевой уровень.
На Хабре опубликован подробный чек-лист для тестирования поисковых систем и RAG-архитектур. Авторы выделяют шесть уровней проверок: Уровень 0 — функциональный (движок находит по указанным полям, исправляет опечатки, обрабатывает пустой запрос и спецсимволы); Уровень 1 — классический Information Retrieval с метриками Precision@k, Recall@k, NDCG, MRR, MAP на размеченном golden query set; Уровень 2
Показать ещё ↓
- Сокращения
- RAG = Retrieval-Augmented Generation — генерация с дополнением поиском
- LLM = Large Language Model — большая языковая модель
- NDCG = Normalized Discounted Cumulative Gain — нормированный дисконтированный кумулятивный выигрыш
- MRR = Mean Reciprocal Rank — средняя обратная позиция первого правильного ответа
- MAP = Mean Average Precision — средняя средняя точность
- CI/CD = Continuous Integration / Continuous Deployment — непрерывная интеграция / непрерывное развёртывание
Источник: Habr — хаб NLP —
оригинал
