RAG: Benchmarks Quan Trọng Hơn Code. Câu Chuyện Về Một Bot Nơi Các Cải Tiến 'Chuẩn' Lại Làm Kết Quả Tệ Hơn
Một nhà phát triển đã xây dựng một bot RAG để kiểm duyệt các cuộc trò chuyện về tiền điện tử nhưng phát hiện ra rằng các cải tiến tiêu chuẩn — BM25 và một bộ xếp hạng lại — chỉ làm giảm các chỉ số. Thay đổi hiệu quả duy nhất là hiệu chỉnh ngưỡng cắt. Bài báo nhấn mạnh tầm quan trọng của việc đánh giá điểm chuẩn kỹ lưỡng trên dữ liệu của chính bạn.
Một nhà phát triển đã xây dựng một bot RAG để hỗ trợ có mục tiêu cho người dùng chat về tiền điện tử: bot có nhiệm vụ tìm các truy vấn tương tự và hiển thị các phản hồi quản trị viên có sẵn. Sử dụng kho dữ liệu gồm 3,9 triệu tin nhắn và bộ đánh giá 51 câu hỏi, ông đo được độ chính xác hit@3 cơ sở cho tìm kiếm vector thuần túy là 74%. Khi cố gắng cải thiện hệ thống, ông thêm tìm kiếm kết hợp (hybrid search) với BM25 và bộ xếp hạng chéo (cross-encoder reranker). Cả hai thay đổi đều làm giảm chỉ số: hybrid cho 55%, reranker cho 64%, hybrid kết hợp reranker cho 57%. Phân tích cho thấy BM25 không hiệu quả do thiếu token chính xác trong kho dữ liệu câu hỏi mẫu, trong khi reranker làm hỏng thứ hạng vốn đã tốt. Thay đổi có lợi duy nhất là điều chỉnh ngưỡng cắt (cutoff threshold) để phù hợp với vai trò của bot (như một phương án dự phòng, không phải người trả lời cuối cùng): điều này cải thiện đầu ra hữu ích mà không cần thêm mã nguồn. Bài học chính là trong RAG, điều quan trọng không phải là các mặc định của ngành, mà là các phép đo trung thực và làm sạch dữ liệu.
Nguồn: Habr — хаб ИИ —
bản gốc
