为复杂语义文本构建本地RAG:当云端人工智能失效且MiniLM在哲学领域表现不佳时
Sentence-Transformers (UKPLab)
LM Studio
一位开发者讲述了为简·罗伯茨的哲学文本构建本地RAG(检索增强生成)管道的经历,使用了多语言e5-large嵌入模型和通过LM Studio运行的Qwen2.5。项目包含数据准备、标记、分块和检索。作者希望社区就Chroma索引架构、对话状态管理以及重排序器的使用提供反馈。
一位开发者在使用云AI模型产生幻觉和失败后,为简·罗伯茨的哲学文本构建了一个本地RAG系统。原始扫描件被清理,用XML标记说话者标签,并按段落分块。对于嵌入,multilingual-e5-large 的性能优于 all-MiniLM-L6-v2,后者在抽象术语上表现出较高的语义漂移。该流水线使用 ChromaDB 进行向量存储,并通过 LM Studio 使用 Qwen2.5-14B-coder 进行生成。关键的工程决策包括双重增强(对 E5 使用“段落:”前缀,对 LLM 使用“引用我书中的内容”提示)、过滤掉舞台指示类的交付方式,以及多语言支持。作者提出了三个未解决的问题:随着数据增长,是否将 Chroma 索引拆分为多个集合;如何在不过度消耗 token 预算的情况下实现对话记忆;以及交叉编码器重排序器是否能提高当前 911 个块上的检索准确性。该项目作为研究日志发布在 GitHub 上。
来源: Habr — хаб ИИ —
原文
