Expedia Constrói Plataforma de AI Ops com Fluxos de Trabalho Determinísticos, Não Agentes de IA
Expedia
Langfuse
O Expedia Group lançou o STAR, uma plataforma interna de observabilidade assistida por IA que combina métricas operacionais com LLMs por meio de fluxos de trabalho de diagnóstico predefinidos. A abordagem determinística ajuda engenheiros a investigar incidentes de produção, gerando avaliações estruturadas de causa raiz, reduzindo o tempo para conhecimento e o tempo para recuperação, mantendo humanos no ciclo para validação.
O Expedia Group apresentou o Service Telemetry Analyzer (STAR), uma plataforma de observabilidade assistida por IA que ajuda engenheiros a investigar incidentes de produção por meio da análise de dados de telemetria de serviços e da geração de avaliações estruturadas de causas raiz. O sistema segue um fluxo de trabalho determinístico em vez de usar agentes de IA autônomos: ele coleta dados de telemetria, realiza análises com prompts específicos de domínio, agrega descobertas e produz um relatório com possíveis causas raiz e próximos passos sugeridos. O STAR é implementado como uma aplicação FastAPI integrada ao Datadog para métricas e a um gateway interno de IA generativa para acesso a grandes modelos de linguagem (large language models - LLMs). Ele usa encadeamento de prompts para executar várias análises especializadas antes de gerar um diagnóstico consolidado. A plataforma foca em telemetria de infraestrutura padronizada de serviços baseados em Kubernetes e aplicações JVM, incluindo métricas como throughput de requisições, latência, taxas de erro, uso de CPU/memória, reinicializações de contêineres e uso de heap Java. A Expedia substituiu as tarefas em segundo plano do FastAPI por uma arquitetura Celery assíncrona usando Redis como broker e backend de resultados para lidar com operações intensivas de I/OU e limites de taxa. O STAR é usado para investigação de incidentes de produção, análise pós-incidente, solução de problemas em Kubernetes e diagnóstico de memória JVM. Os planos futuros incluem adicionar informações de dependência de serviços, integração com a ferramenta Protocolo de Contexto de Modelo (Model Context Protocol - MCP) e interfaces conversacionais. O gerenciamento e a avaliação de prompts são suportados pelo Langfuse.
Fonte: InfoQ 中国 —
original
