정직한 RAG 평가 세트 구축: 스스로를 속이지 않고 첫 100-300개 사례를 수집하는 방법
Microsoft
이 기사는 스모크 테스트 및 학습 데이터와 별도로 RAG 시스템을 위한 수동 평가 세트를 만드는 것의 중요성을 논의합니다. 여러 시나리오에서 100-300개의 신중하게 선별된 사례를 수집하고, 검색 및 답변 생성을 별도로 라벨링하며, Recall@k, MRR@k, nDCG@k와 같은 지표를 사용할 것을 제안합니다. 합성 데이터와 공개 벤치마크는 도메인 특화 검색 평가에 충분하지 않습니다.
저자는 MTEB나 BEIR과 같은 공개 벤치마크가 도메인 특화 작업에서 우수한 검색 성능을 보장하지 않으며, 합성 데이터는 지나치게 정돈된 형태로 이어질 수 있다고 주장합니다. 대신, 로그, 문서, 전문가 인터뷰, 그리고 검토 후 합성 후보에서 얻은 120개의 사례로 실질적인 시작을 하는 100-300개 케이스의 수동 평가 세트를 구축할 것을 권장합니다. 각 케이스에는 쿼리, 시나리오, 예상 문서 ID, 골드 증거 스팬, 기대 사실, 답변 가능성, 그리고 왜 중요한지와 같은 필드를 포함해야 합니다. 세트는 정확한 엔터티, paraphrasing, 긴 구간, 표, 버전, 답변 없음 케이스, 부적절한 표현, 민감한 시나리오를 다루는 6-8개의 슬라이스로 나누어야 합니다. 검색과 답변 생성은 별도로 평가되어야 하며, 검색 지표로는 Recall@k, MRR@k, nDCG@k를 사용하고, 답변 지표로는 근거 기반, 완전성, 답변 관련성, 올바른 기권을 사용합니다. 저자는 답변 없음 슬라이스의 경우 표준 recall이 의미가 없으므로 별도의 릴리스 게이트를 제안합니다. 또한 평가 세트에 학습 데이터를 사용하는 것에 대해 경고하고, 수동 서브셋에서 LLM-as-a-judge를 검증할 것을 권장합니다.
출처: Habr — хаб ИИ —
원문
