Expedia construye una plataforma de AI Ops con flujos de trabajo deterministas, no agentes de IA
Expedia
Langfuse
Expedia Group ha lanzado STAR, una plataforma interna de observabilidad asistida por IA que combina métricas operativas con LLM a través de flujos de trabajo de diagnóstico predefinidos. El enfoque determinista ayuda a los ingenieros a investigar incidentes de producción generando evaluaciones estructuradas de causa raíz, reduciendo el tiempo hasta el conocimiento (TTK) y el tiempo hasta la recuperación (TTR), mientras mantiene a los humanos en el circuito para la validación.
Expedia Group presentó Service Telemetry Analyzer (STAR), una plataforma de observabilidad asistida por IA que ayuda a los ingenieros a investigar incidentes de producción analizando datos de telemetría de servicios y generando evaluaciones estructuradas de causas raíz. El sistema sigue un flujo de trabajo determinista en lugar de utilizar agentes de IA autónomos: recopila datos de telemetría, realiza análisis con indicaciones específicas del dominio, agrega hallazgos y produce un informe con posibles causas raíz y próximos pasos sugeridos. STAR se implementa como una aplicación FastAPI integrada con Datadog para métricas y una puerta de enlace de IA generativa interna para acceso a modelos de lenguaje de gran tamaño (LLM). Utiliza encadenamiento de indicaciones para ejecutar múltiples análisis especializados antes de generar un diagnóstico consolidado. La plataforma se centra en telemetría de infraestructura estandarizada de servicios basados en Kubernetes y aplicaciones JVM, incluyendo métricas como rendimiento de solicitudes, latencia, tasas de error, uso de CPU/memoria, reinicios de contenedores y uso de heap de Java. Expedia reemplazó las tareas en segundo plano de FastAPI con una arquitectura Celery asíncrona usando Redis como broker y backend de resultados para manejar operaciones intensivas de entrada/salida y límites de tasa. STAR se utiliza para investigación de incidentes de producción, análisis post-incidente, resolución de problemas en Kubernetes y diagnóstico de memoria JVM. Los planes futuros incluyen agregar información de dependencias de servicios, integración con la herramienta Model Context Protocol (MCP) e interfaces conversacionales. La gestión y evaluación de indicaciones se respalda con Langfuse.
Fuente: InfoQ 中国 —
original
