Daftar Periksa Pengujian untuk Sistem Pencarian dan RAG: Enam Tingkat Pemeriksaan
Sebuah daftar periksa untuk menguji sistem pencarian dan RAG (Retrieval-Augmented Generation) disajikan, mencakup enam tingkat pemeriksaan — dari fungsionalitas dasar hingga penanganan data yang tidak lengkap. Metrik, alat, dan glosarium dengan lebih dari 50 istilah dijelaskan. Pentingnya urutan tingkat ditekankan: tidak ada gunanya mengevaluasi RAG jika tingkat nol belum dilewati.
Sebuah panduan rinci untuk menguji mesin pencari dan arsitektur RAG telah dipublikasikan di Habr. Para penulis mengidentifikasi enam level pengujian: Level 0 — fungsional (mesin pencari mengambil berdasarkan bidang yang ditentukan, memperbaiki salah ketik, menangani kueri kosong dan karakter khusus); Level 1 — Information Retrieval klasik dengan metrik Precision@k, Recall@k, NDCG, MRR, MAP pada set kueri emas yang telah dilabeli; Level 2 — kualitas konteks yang diambil untuk RAG (Contextual Precision dan Recall); Level 3 — kualitas generasi RAG (Faithfulness, Hallucination Rate, Answer Relevance, Completeness, akurasi kutipan); Level 4 — agensi dan navigasi melalui knowledge graph (multi-hop, ketepatan alat, penyelesaian tugas, kepatuhan terhadap rencana); Level 5 — penanganan data yang tidak lengkap dan terkait secara longgar (abstention, over-extrapolation, konflik antara data usang dan data terbaru). Untuk setiap level, disediakan alat yang direkomendasikan: pytest, Hypothesis, Postman, k6 untuk Level 0; ranx, trec_eval untuk Level 1; deepeval, RAGAS, TruLens untuk Level 2–4; G-Eval kustom untuk Level 5. Penekanan khusus diberikan pada perlunya pengujian berurutan — tidak ada gunanya mengevaluasi metrik RAG jika mesin pencari gagal dalam pengujian dasar, seperti tidak menemukan dokumen karena salah ketik.
Sumber: Habr — хаб NLP —
asli
