Создание честного набора для оценки RAG: как собрать первые 100-300 случаев, не обманывая себя
В статье обсуждается важность создания набора для ручной оценки систем RAG, отдельного от смоук-тестов и обучающих данных. Предлагается собирать 100-300 тщательно отобранных случаев в нескольких сценариях, раздельно размечая поиск и генерацию ответов, и использовать метрики, такие как Recall@k, MRR@k и nDCG@k. Синтетические данные и публичные бенчмарки недостаточны для оценки поиска в конкретной предметной области.
Автор утверждает, что публичные бенчмарки, такие как MTEB и BEIR, не гарантируют хорошего поиска в специализированных задачах, а синтетические данные могут приводить к излишне «чистым» формулировкам. Вместо этого рекомендуется создать ручной оценочный набор из 100–300 примеров, начав на практике со 120 случаев, взятых из журналов, документации, интервью с экспертами и одобренных после проверки
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
