AnwendungenAgenten 🇨🇳 30.07.2026 10:02

Expedia baut KI-Ops-Plattform mit deterministischen Workflows, nicht mit KI-Agenten

ExpediaExpedia LangfuseLangfuse
Die Expedia Group hat STAR eingeführt, eine interne KI-gestützte Beobachtbarkeitsplattform, die Betriebsmetriken mit großen Sprachmodellen durch vordefinierte Diagnose-Workflows kombiniert. Der deterministische Ansatz hilft Ingenieuren bei der Untersuchung von Produktionsvorfällen, indem er strukturierte Ursachenbewertungen generiert und so die Zeit bis zum Wissensgewinn und die Zeit bis zur Wiederherstellung verkürzt, während der Mensch für die Validierung im Kreislauf bleibt.
Expedia Group hat den Service Telemetry Analyzer (STAR) vorgestellt, eine KI-gestützte Observability-Plattform, die Ingenieuren bei der Untersuchung von Produktionsvorfällen hilft, indem sie Telemetriedaten von Diensten analysiert und strukturierte Ursachenanalysen erstellt. Das System folgt einem deterministischen Workflow anstatt autonome KI-Agenten zu verwenden: Es sammelt Telemetriedaten, führt Analysen mit domänenspezifischen Prompts durch, aggregiert die Ergebnisse und erstellt einen Bericht mit möglichen Ursachen und empfohlenen nächsten Schritten. STAR ist als FastAPI-Anwendung implementiert, die für Metriken in Datadog und für den Zugriff auf ein Large Language Model (LLM) über ein internes generatives KI-Gateway integriert ist. Es verwendet Prompt-Chaining, um mehrere spezialisierte Analysen durchzuführen, bevor eine konsolidierte Diagnose erstellt wird. Die Plattform konzentriert sich auf standardisierte Infrastrukturtelemetrie von Kubernetes-basierten Diensten und Java Virtual Machine (JVM)-Anwendungen, einschließlich Metriken wie Anforderungsdurchsatz, Latenz, Fehlerraten, CPU- und Arbeitsspeicherauslastung, Container-Neustarts sowie Java-Heap-Nutzung. Expedia hat die Hintergrundaufgaben von FastAPI durch eine asynchrone Celery-Architektur mit Redis als Broker und Ergebnis-Backend ersetzt, um I/O-intensive Operationen und Ratenbegrenzungen zu bewältigen. STAR wird für die Untersuchung von Produktionsvorfällen, die Analyse nach Vorfällen, die Fehlerbehebung bei Kubernetes und die JVM-Speicherdiagnose eingesetzt. Zu den zukünftigen Plänen gehören die Aufnahme von Informationen über Dienstabhängigkeiten, die Integration des Model Context Protocol (MCP)-Tools sowie die Entwicklung von Konversationsschnittstellen. Prompt-Management und -Evaluierung werden von Langfuse unterstützt.
Quelle: InfoQ 中国 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten