如何训练基础设施LLM代理不说谎
DeepSeek
构建了一个只读AI代理用于基础设施事件调查。起初它给出看似合理但无用的答案。团队通过将LLM移至应用内部、添加工具合约、证据防护和结构化规划解决了问题。最近一次运行中,45个测试场景通过了44个。
内部构建了一个只读的LLM代理,用于回答基础设施问题,例如“服务为什么返回502?”。该代理使用Go语言,未采用LangChain,并通过兼容OpenAI的API调用了DeepSeek-V4-Flash和Qwen3.6-27B-FP8模型。第一个版本使用了免费的ReAct循环,生成的答案虽然形式上正确,但往往具有误导性。例如,当502错误是由于代理处响应头过大引起时,代理得出了“应用层无错误”的结论,忽略了真正的原因。共识别出五类错误:作用域错误、时间语义错误、错误否定结论、证据缺失以及不受控制的重新规划。解决方案是将LLM嵌入到一个严格的应用框架中。工具调用由扩展合约x-agent管理,该合约定义了证据、输出类型、时效性、否定语义以及只读状态。规划器首先构建目标(例如,symptom.http_502、route.edge_to_ingress)和停止条件:每个必需目标必须被解决或明确不可用。证据守卫阻止最终确定器在所有目标达成之前得出结论。工具选择是分阶段的:策略过滤、词汇预过滤、LLM重排序(前8个),然后是目标相关性门控。风险意图具有确定性的预路由。在最终评估中,45个场景中有44个通过(29个必选项全部通过),每个场景运行两次。唯一失败的测试是一个可选的容量报告格式。该代理保持只读状态,由人类决定生产变更。
来源: Habr — хаб ИИ —
原文
