синтетических кандидатов. Каждый пример должен включать такие поля, как запрос, сценарий, идентификаторы ожидаемых документов, эталонные фрагменты с доказательствами, ожидаемые факты, возможность ответа и обоснование значимости. Набор следует разделить на 6–8 срезов, охватывающих точные сущности, перефразирование, длинные разделы, таблицы, версии, случаи без ответа, плохо сформулированные запросы и чувствительные сценарии. Поиск и генерацию ответов следует оценивать отдельно: метрики поиска включают Recall@k, MRR@k и nDCG@k, а метрики ответов — обоснованность, полноту, релевантность ответа и корректное воздержание от ответа. Автор подчеркивает, что для среза «без ответа» стандартный recall бессмысленен, и предлагает отдельный порог выпуска. Он также предостерегает от использования обучающих данных в оценочном наборе и рекомендует проверять LLM-как-судью на ручном подмножестве.