Nghiên cứuMô hình 🇷🇺 27.07.2026 02:04

LLM-wiki so với RAG: So sánh các phương pháp sinh câu trả lời cho tài liệu doanh nghiệp

OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic
Tác giả đã so sánh LLM-wiki (dựa trên một tác nhân wiki) với một hệ thống RAG đơn giản sử dụng tài liệu tổng hợp có tên "Directive 401." Kết quả cho thấy LLM-wiki luôn vượt trội hơn RAG về độ đầy đủ của câu trả lời (recall), trong khi sự khác biệt về độ chính xác (precision) là không đáng kể. Chi phí xây dựng wiki là dưới 3,7 đô la Mỹ.
Tác giả đã tiến hành một thí nghiệm so sánh hai phương pháp tạo câu trả lời dựa trên tài liệu: LLM-wiki (lấy cảm hứng từ ý tưởng của Andrej Karpathy) và một hệ thống RAG đơn giản với bộ truy xuất vector. Văn bản nguồn là một tài liệu công ty tổng hợp có tiêu đề "Chỉ thị 401" dài khoảng 100.000 ký tự, được chuẩn bị bởi mô hình gemma4:31b. Các câu hỏi (20 câu hỏi thực tế và 20 câu hỏi dựa trên tình huống) được tổng hợp bởi mô hình gpt-5.1. Để xây dựng wiki, tài liệu nguồn được chia thành 25 phần (24 điều khoản cộng với một trang tiêu đề), sau đó thêm tệp AGENTS.md vào Obsidian và sử dụng Claude Code (Sonnet 5), 32 trang wiki được tạo ra trong 20 phút với chi phí dưới 3,7 đô la. Tác nhân wiki bao gồm bốn thành phần: Navigator (gpt-4.1-mini), Linker (gpt-4.1-mini), Context Collector và Synthesizer (gpt-4.1). Hệ thống RAG sử dụng LangChain, ChromaDB, FastAPI và các embedding cục bộ; các đoạn được tạo dựa trên cấp độ thứ hai của việc đánh số điều khoản (tổng cộng 144 đoạn). Việc đánh giá sử dụng các chỉ số Precision và Recall: các sự kiện trong câu trả lời được so sánh với một tham chiếu—câu trả lời từ một LLM đã xem toàn bộ văn bản. Kết quả từ ba cấu hình tác nhân wiki (không có quyền truy cập nguồn, có quyền truy cập, có quyền truy cập và linker) cho thấy recall trung vị của LLM-wiki là khoảng 0,72 so với 0,54–0,57 của RAG, với giá trị p từ 10⁻⁸ đến 10⁻¹¹ sử dụng kiểm định Wilcoxon. Về precision, sự khác biệt có ý nghĩa thống kê chỉ ở hai cấu hình (p < 0,05) và biến mất hoàn toàn khi thêm linker (p = 0,348). Linker không mang lại cải thiện có ý nghĩa thống kê. Quyền truy cập nguồn giúp ích vừa phải cho các câu hỏi thực tế, nhưng hiệu ứng rất nhỏ. Tác giả lưu ý rằng các kết luận chỉ giới hạn trong tập dữ liệu này.
Nguồn: Habr — хаб NLP — bản gốc
Bài viết liên quan trước đây ↓
Tin mới