LLM-wiki 与 RAG:企业文档答案生成方法对比
OpenAI
Google DeepMind
Anthropic
作者使用合成文档“指令 401”对比了基于维基代理的 LLM-wiki 与简单 RAG 系统。结果显示,LLM-wiki 在答案完整性(召回率)上始终优于 RAG,而精确度差异可忽略不计。构建该维基的成本低于 3.7 美元。
作者开展了一项实验,比较了两种基于文档生成答案的方法:LLM-wiki(灵感来自安德烈·卡帕西的想法)和带有向量检索器的简单 RAG 系统。源文本是一份约 10 万字符的合成企业文档,标题为“指令 401”,由 gemma4:31b 模型生成。20 个事实性问题和 20 个案例型问题由 gpt-5.1 模型合成。为构建 wiki,源文档被分成 25 个部分(24 篇文章加一个标题页),然后在 Obsidian 中添加了文件 AGENTS.md,使用 Claude Code (Sonnet 5) 在 20 分钟内生成了 32 个 wiki 页面,成本低于 3.7 美元。wiki 代理由四个组件组成:导航器(gpt-4.1-mini)、链接器(gpt-4.1-mini)、上下文收集器和合成器(gpt-4.1)。RAG 系统使用了 LangChain、ChromaDB、FastAPI 和本地嵌入;根据文章编号的第二级进行分块(共 144 个块)。评估使用了精确率和召回率指标:将答案中的事实与参考标准——即阅读了全文的 LLM 给出的答案进行对比。三种 wiki 代理配置(无法访问源文本、可访问源文本、可访问源文本并带有链接器)的结果显示,LLM-wiki 的中位召回率约为 0.72,而 RAG 的中位召回率为 0.54–0.57,Wilcoxon 检验的 p 值范围为 10⁻⁸ 到 10⁻¹¹。在精确率方面,仅在两种配置中差异具有统计学显著性(p < 0.05),当添加链接器后,差异完全消失(p = 0.348)。链接器并未带来统计上显著的改进。可访问源文本对事实性问题有一定帮助,但效果甚微。作者指出,这些结论仅限于该数据集。
来源: Habr — хаб NLP —
原文
