研究 🇷🇺 12.08.2026 13:04

不使用Claude Code构建个人知识库:基于MapReduce的流水线

AnthropicAnthropic OpenAIOpenAI OllamaOllama
本文介绍如何在不使用Claude Code的情况下,利用gpt-5-mini和gemma4:26b等较弱模型构建个人知识库。在两种策略失败后,一种基于MapReduce的方法(包括关键术语提取、大语言模型过滤和链接生成)取得了成功。该流水线名为Wiki-assembler,使用Python实现,包含简单的LangChain代理,成本低于Claude Code。
受安德烈·卡帕西关于大语言模型生成维基想法的启发,一位Habr用户探索了用Claude Code之外的方法来构建个人维基。他们测试了三种策略:带上下文记忆的逐条提取、带独立整合代理的批量提取,以及MapReduce方法。前两种失败了——第一种是因为弱模型在元素数量超过十个时会丢失内容;第二种是因为整合不善,把不相关的条目合并在一起。第三种,即MapReduce方法,取得了成功:每个来源被标注并提取关键术语,然后对术语进行倒排,将每个术语映射到其来源。一个LLM评判器按重要性筛选术语;对重要术语,创建一个维基条目,包含摘要、属性和指向相关条目的链接。该流水线使用来自代理供应商的gpt-5-mini和本地Ollama的gemma4:26b。gpt-5-mini倾向于高估重要性,有时还会自行添加术语,但链接器会捕获这个问题;gemma4:26b更严格,但在结构化输出方面有困难,需要在代码中拆分处理。成本方面:Claude Code每100KB源文本花费3-4美元,gpt-5-mini花费1.1-1.3美元,而gemma4:26b仅耗电,但速度慢(每秒12个token,运行完整流水线需要一整天)。这个实现名为Wiki-assembler,是一个Python流水线,由五或六个简单的LangChain代理和两个硬编码块组成,避免使用ReAct,因为Gemma会无限推理。流水线步骤包括标注和分类、通过LLM评判器筛选关键术语、构建维基条目以及链接它们。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻