RAG: 벤치마크가 코드보다 중요합니다. '적절한' 개선이 오히려 결과를 악화시킨 봇 이야기
한 개발자가 암호화폐 채팅을 중재하기 위한 RAG 봇을 구축했지만, BM25와 재순위화 같은 표준적인 개선 사항이 오히려 메트릭을 저하시킨다는 사실을 발견했습니다. 유일하게 효과적이었던 변경 사항은 컷오프 임계값을 조정하는 것이었습니다. 이 기사는 자체 데이터에 대한 철저한 벤치마킹의 중요성을 강조합니다.
한 개발자가 암호화폐 채팅 사용자를 대상으로 한 RAG 봇을 구축하려 했습니다. 이 봇은 유사한 질문을 찾아 기존 관리자 답변을 보여주는 역할을 했습니다. 390만 개의 메시지로 구성된 코퍼스와 51개 질문의 평가 세트를 사용하여 순수 벡터 검색의 기준 hit@3을 74%로 측정했습니다. 시스템을 개선하기 위해 BM25를 사용한 하이브리드 검색과 크로스-인코더 재순위화기를 추가했습니다. 두 변경 모두 지표를 낮췄습니다. 하이브리드는 55%, 재순위화기는 64%, 하이브리드+재순위화기는 57%를 기록했습니다. 분석 결과, BM25는 샘플 질문 코퍼스에 정확한 토큰이 없어 효과적이지 않았고, 재순위화기는 이미 좋은 순위를 망쳤습니다. 유일하게 유익한 변경은 컷오프 임계값을 봇의 역할(최종 답변이 아닌 폴백으로서)에 맞게 조정한 것이었습니다. 이는 추가 코드 없이 유용한 출력을 개선했습니다. 주요 교훈은 RAG에서 중요한 것은 업계 기본값이 아니라 정직한 측정과 데이터 정리라는 점입니다.
출처: Habr — хаб ИИ —
원문
