Nghiên cứu 🇷🇺 15.08.2026 04:02

Xây dựng bộ đánh giá RAG trung thực: Cách thu thập 100-300 trường hợp đầu tiên mà không tự lừa dối bản thân

MicrosoftMicrosoft
Bài viết thảo luận về tầm quan trọng của việc tạo bộ đánh giá thủ công cho hệ thống RAG, tách biệt với các bài kiểm tra nhanh và dữ liệu huấn luyện. Nó đề xuất thu thập 100-300 trường hợp được chọn lọc kỹ lưỡng qua nhiều kịch bản, gán nhãn riêng cho truy xuất và tạo câu trả lời, sử dụng các chỉ số như Recall@k, MRR@k và nDCG@k. Dữ liệu tổng hợp và các chuẩn công khai không đủ để đánh giá truy xuất theo từng lĩnh vực cụ thể.
Tác giả lập luận rằng các chuẩn mực công khai như MTEB và BEIR không đảm bảo khả năng truy xuất tốt trên các tác vụ cụ thể theo lĩnh vực, còn dữ liệu tổng hợp có thể dẫn đến các công thức hóa quá gọn gàng. Thay vào đó, họ khuyến nghị xây dựng một bộ đánh giá thủ công gồm 100-300 trường hợp, với điểm khởi đầu thực tế là 120 trường hợp lấy từ nhật ký, tài liệu, phỏng vấn chuyên gia và các ứng cử viên dữ liệu tổng hợp sau khi đã được xem xét. Mỗi trường hợp cần bao gồm các trường như truy vấn, tình huống, ID tài liệu dự kiến, đoạn bằng chứng tiêu chuẩn vàng, sự kiện dự kiến, khả năng trả lời và lý do tại sao nó quan trọng. Bộ dữ liệu này nên được chia thành 6-8 nhóm nhỏ, bao gồm các thực thể chính xác, diễn đạt lại, phần dài, bảng, phiên bản, trường hợp không có câu trả lời, diễn đạt kém và các tình huống nhạy cảm. Việc truy xuất và tạo câu trả lời cần được đánh giá riêng biệt, với các chỉ số truy xuất bao gồm Recall@k, MRR@k và nDCG@k, còn các chỉ số câu trả lời bao gồm tính gắn kết, đầy đủ, mức độ liên quan của câu trả lời và khả năng từ chối trả lời chính xác. Tác giả nhấn mạnh rằng đối với các nhóm không có câu trả lời, độ nhớ chuẩn là không có ý nghĩa và đề xuất một cổng phát hành riêng. Họ cũng cảnh báo chống việc sử dụng dữ liệu huấn luyện trong bộ đánh giá và đề xuất việc xác nhận đánh giá viên dạng LLM trên một tập hợp con thủ công.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới