Ứng dụngNghiên cứu 🇷🇺 27.07.2026 09:05

Danh sách kiểm tra thử nghiệm cho hệ thống tìm kiếm và RAG: Sáu cấp độ kiểm tra

Một danh sách kiểm tra để thử nghiệm hệ thống tìm kiếm và RAG (Retrieval-Augmented Generation - Sinh tăng cường truy xuất) được trình bày, bao gồm sáu cấp độ kiểm tra — từ chức năng cơ bản đến xử lý dữ liệu không hoàn chỉnh. Các số liệu, công cụ và bảng chú giải hơn 50 thuật ngữ được mô tả. Tầm quan trọng của trình tự các cấp độ được nhấn mạnh: việc đánh giá RAG sẽ vô nghĩa nếu cấp độ cơ bản chưa được vượt qua.
Một danh sách kiểm tra chi tiết để kiểm tra công cụ tìm kiếm và kiến trúc RAG đã được đăng tải trên Habr. Các tác giả xác định sáu cấp độ kiểm tra: Cấp 0 — chức năng (công cụ truy xuất theo các trường đã chỉ định, sửa lỗi chính tả, xử lý truy vấn rỗng và ký tự đặc biệt); Cấp 1 — Truy xuất thông tin cổ điển với các chỉ số Precision@k, Recall@k, NDCG, MRR, MAP trên một tập truy vấn vàng đã được gán nhãn; Cấp 2 — chất lượng của ngữ cảnh được truy xuất cho RAG (Độ chính xác ngữ cảnh và Độ thu hồi ngữ cảnh); Cấp 3 — chất lượng tạo sinh của RAG (Độ trung thực, Tỷ lệ ảo giác, Mức độ liên quan của câu trả lời, Tính đầy đủ, độ chính xác của trích dẫn); Cấp 4 — năng lực tác nhân và điều hướng qua đồ thị tri thức (đa bước, tính đúng đắn của công cụ, hoàn thành tác vụ, tuân thủ kế hoạch); Cấp 5 — xử lý dữ liệu không đầy đủ và có liên quan lỏng lẻo (từ chối trả lời, ngoại suy quá mức, xung đột giữa dữ liệu lỗi thời và hiện tại). Đối với mỗi cấp độ, các công cụ được khuyến nghị được cung cấp: pytest, Hypothesis, Postman, k6 cho Cấp 0; ranx, trec_eval cho Cấp 1; deepeval, RAGAS, TruLens cho Cấp 2–4; G-Eval tùy chỉnh cho Cấp 5. Đặc biệt nhấn mạnh vào nhu cầu kiểm tra tuần tự — không có ý nghĩa gì khi đánh giá các chỉ số RAG nếu công cụ tìm kiếm thất bại trong các bài kiểm tra cơ bản, chẳng hạn như không tìm thấy tài liệu do lỗi chính tả.
Nguồn: Habr — хаб NLP — bản gốc
Bài viết liên quan trước đây ↓
Tin mới