为什么AI代理实际上比RAG更便宜
虽然经典的RAG助手每次查询看起来更便宜,但用户后续跟进和操作员升级等隐性成本使其整体更昂贵。使用ReAct循环的代理会自动搜索多个文档,直到找到完整答案,将需要3次尝试、27分钟的过程转变为一次4分钟的解答。来自支持项目的真实试点数据证实,代理解决问题的成本仅为RAG助手的三分之一。
文章认为,将RAG助手与智能体之间的成本进行简单对比存在误导性。经典RAG助手仅发起一次LLM调用,若回答错误则依赖用户自行优化查询。实际应用中,用户通常在2-3次尝试后放弃,转而由人工客服处理,而人工客服需花费10-15分钟解决问题。这导致的总成本远高于单次LLM调用。基于ReAct循环的智能体则能自主迭代搜索工具、提出假设、检索文本块,并综合生成最终答案,无需用户干预。作者开发的ISTOK智能体使用了五个工具:向量搜索(通过Milvus实现混合式稠密向量与BM25)、搜索(PostgreSQL全文检索)、用于读取完整文档块的OpenChunk、用于获取目录的GetDocumentChunks,以及作为最后手段的CallOperator(在自身尝试2-3次后调用)。为管理上下文窗口限制,智能体最初尝试使用LLM摘要,但发现成本高且不可靠;目前采用滑动窗口机制(保留最近6条消息,丢弃最早的工具消息),并将摘要作为备选方案(每会话最多2次)。LLM调用也进行了分级:廉价的嵌入与重排序、简单步骤的轻量生成、常规推理的中等调用,以及仅用于最终综合或摘要的高成本调用。在一个实际试点中(约1200份文档,月均1800次请求),助手平均每次问题关闭需1次LLM调用、2.3次用户后续操作、34%的升级率、27分钟处理时间,以及约18,000个token。而智能体平均需6.4次LLM调用、0.3次用户后续操作、11%的升级率、4分钟处理时间,以及约15,500个token。从直接成本看,助手每次问题关闭的成本约52卢布(含人工客服成本),而智能体约17卢布,成本降低至原来的三分之一。但对于简单事实性问题或知识库为空的情况,智能体的优势消失,因为其会浪费迭代次数。智能体记录每次调用的token用量及工具历史,并通过Arize Phoenix进行迭代细节追踪。
来源: Habr — хаб ИИ —
原文
