Agentic RAG, chuẩn benchmark TRuST và Nafanya có liên quan gì đến điều đó
DeepSeek
Nafanya là một trợ lý RAG tác tử (agentic RAG) dành cho tài liệu xây dựng và định giá. Tác giả đã điều chỉnh chuẩn benchmark TRuST để kiểm tra nó, đạt được sự cải thiện về các chỉ số thông qua các thay đổi về kiến trúc.
Nafanya là một trợ lý RAG đại lý dành cho tài liệu quy chuẩn và kỹ thuật trong xây dựng và định giá, được phát triển bởi Nikolai. Nó sử dụng kiến trúc đa tác tử với bộ lập kế hoạch, bộ truy xuất, bộ đánh giá, bộ sinh và bộ phê bình. Để kiểm tra khả năng tìm kiếm của mình, tác giả đã điều chỉnh chuẩn TRuST, chứa 324 câu hỏi phức tạp bằng tiếng Nga yêu cầu tìm kiếm đa bước. Ban đầu, hệ thống đạt điểm thấp, nhưng bằng cách giới thiệu CoverageCritic (Bộ phê bình phủ) và tối ưu hóa kiến trúc, Recall All đã cải thiện từ 0,25 lên 0,45 và độ chính xác câu trả lời từ 34% lên 56%. Sau đó, một Final Critic (Bộ phê bình cuối) đã được thêm vào, và hệ thống sử dụng các API bên ngoài như Qwen và DeepSeek. Tác giả lưu ý rằng TRuST dựa trên phương pháp BrowseComp-Plus và bao gồm chỉ mục cố định cùng nhiều loại độ phức tạp tìm kiếm khác nhau.
Nguồn: Habr — хаб ИИ —
bản gốc
