AI根因分析从模型推理转向上下文工程
Anthropic
OpenAI
Google/DeepMind
Dynatrace
Coroot
LangChain
Mezmo
Alibaba/Qwen
可观测性从业者逐渐发现,LLM推理不再是AI辅助根因分析的瓶颈,挑战在于决定向模型输入哪些数据。Coroot的研究表明,投资上下文准备比追求更强的模型能获得更好的回报。行业正朝着确定性的、基于拓扑的因果分析方向发展,而不是开放的代理循环。
越来越多的可观测性工程师认为,大语言模型的推理能力已不再是AI辅助根因分析(RCA)的瓶颈;更紧迫的问题在于决定将哪些数据传递给模型的流水线。大多数AI RCA工作分为两类:基于智能体的设计(赋予模型自主调查的工具)和确定性设计(预先建立信号间的关联并提供预打包的上下文)。Coroot的研究由工程师Nikolay Sivko领导,将过程分为两个任务:对所呈现数据的推理,以及决定哪些数据进入模型的“数据收集框架”。Coroot的流水线将信号关联成调查结果,并以单一聚焦的上下文传递给模型,避免了智能体循环,从而使错误可归因于模型本身。Sivko使用Chaos Mesh NetworkChaos构建了一个场景,在目录服务与其Postgres数据库之间注入延迟,导致慢查询和502错误,并包含误导性信号。他用相同的提示(约9800个令牌)测试了十一个模型,要求每个模型提供根本原因、因果链和即时修复措施。前沿模型Claude Opus 4.8、GPT-5.5和Gemini 3.1 Pro通过了测试,识别出了实验及其定时任务需要删除。在较小模型中,Gemma 4 31B是唯一识别出根本原因的自托管模型,而更大的Qwen3.6 35B和Qwen3 Coder Next则失败了。基于智能体的方法有优势,如能捕获意外信号,但在生产环境中存在可调试性问题,这在ZenML和Incident.io的案例中可见。许多从业者现在更倾向于确定性工作流,并包含一个狭窄的大语言模型步骤,以提升可靠性和降低令牌成本。Sivko指出,由于关联分析在调用前完成,对前沿模型的单次短调用仅花费几美分;他认为推理部分“基本已解决”,当前重点是准备正确且紧凑的上下文。这与更广泛的上下文工程趋势一致,Anthropic、LangChain和Mezmo的指导强调为基于大语言模型的推理和可观测性提供最小且高信号上下文集的重要性。
来源: InfoQ 中国 —
原文
