Dürüst Bir RAG Değerlendirme Seti Oluşturmak: İlk 100-300 Vakayı Kendinizi Kandırmadan Nasıl Toplarsınız
Microsoft
Makale, RAG sistemleri için duman testleri ve eğitim verilerinden ayrı bir manuel değerlendirme seti oluşturmanın önemini tartışıyor. Birkaç senaryoda 100-300 özenle seçilmiş vaka toplamayı, alma ve yanıt üretimini ayrı ayrı etiketlemeyi ve Recall@k, MRR@k ve nDCG@k gibi metrikleri kullanmayı öneriyor. Sentez veri ve genel kıyaslama setleri, alan bazlı alma değerlendirmesi için yetersizdir.
Yazar, MTEB ve BEIR gibi genel kıyaslamaların (benchmark) alana özgü görevlerde iyi bir arama (retrieval) performansı garanti etmediğini ve sentetik verilerin aşırı düzenli formülasyonlara yol açabileceğini savunuyor. Bunun yerine, 100-300 vakadan oluşan manuel bir değerlendirme seti oluşturulmasını öneriyor; pratik bir başlangıç olarak, günlüklerden (log), dokümantasyondan, uzman görüşmelerinden ve gözden geçirildikten sonra sentetik adaylardan elde edilen 120 vaka yeterli olabilir. Her vaka, sorgu, senaryo, beklenen doküman kimlikleri, altın kanıt bölümleri, beklenen gerçekler, yanıtlanabilirlik ve bunun neden önemli olduğu gibi alanları içermelidir. Set, tam varlıklar, parafraz, uzun bölümler, tablolar, sürümler, yanıtı olmayan vakalar, kötü ifade edilmiş sorgular ve hassas senaryoları kapsayan 6-8 dilime ayrılmalıdır. Arama ve yanıt üretimi ayrı ayrı değerlendirilmelidir; arama metrikleri olarak Recall@k, MRR@k ve nDCG@k, yanıt metrikleri olarak ise gerçeklere dayanıklılık (groundedness), eksiksizlik, yanıt ilgililiği ve doğru çekimserlik kullanılmalıdır. Yazar, yanıtı olmayan dilimler için standart geri çağırma (recall) metriğinin anlamsız olduğunu vurguluyor ve ayrı bir yayın eşiği öneriyor. Ayrıca değerlendirme setinde eğitim verisi kullanılmaması gerektiği konusunda uyarıyor ve LLM-as-a-judge yönteminin manuel bir alt küme üzerinde doğrulanmasını öneriyor.
Kaynak: Habr — хаб ИИ —
orijinal
