Expedia 构建 AI Ops 平台:采用确定性工作流而非 AI 代理
Expedia
Langfuse
Expedia Group 推出了内部 AI 辅助可观测性平台 STAR,该平台通过预定义的诊断工作流,将运营指标与大语言模型(LLMs)相结合。这种确定性方法帮助工程师调查生产事故,生成结构化的根因评估,从而减少知识获取时间(TTK)和恢复时间(TTR),同时保留人类验证环节。
Expedia Group 推出了服务遥测分析器(STAR),这是一个由人工智能辅助的可观测性平台,通过分析服务遥测数据并生成结构化的根本原因评估,帮助工程师调查生产事故。该系统遵循确定性工作流程,而非使用自主人工智能代理:它收集遥测数据,利用领域特定提示执行分析,汇总发现结果,并生成包含潜在根本原因和建议后续步骤的报告。STAR 实现为一个集成 Datadog 用于指标监控、并通过内部生成式AI网关访问大语言模型(LLM)的 FastAPI 应用程序。它使用提示链(prompt chaining)在生成综合诊断之前执行多项专门分析。该平台专注于基于 Kubernetes 的服务和 Java 虚拟机(JVM)应用程序的标准化基础设施遥测数据,包括请求吞吐量、延迟、错误率、CPU/内存使用率、容器重启次数和 Java 堆使用量等指标。Expedia 将 FastAPI 后台任务替换为使用 Redis 作为消息代理和结果后端的异步 Celery 架构,以处理输入/输出密集型操作和速率限制。STAR 用于生产事故调查、事后分析、Kubernetes 故障排除和 JVM 内存诊断。未来计划包括添加服务依赖信息、模型上下文协议(MCP)工具集成以及对话界面。提示管理和评估由 Langfuse 支持。
来源: InfoQ 中国 —
原文
