ApplicationsAgents 🇨🇳 30.07.2026 10:02

Expedia construit une plateforme d'IA opérationnelle avec des workflows déterministes, pas des agents d'IA

ExpediaExpedia LangfuseLangfuse
Expedia Group a lancé STAR, une plateforme interne d'observabilité assistée par IA qui combine des métriques opérationnelles avec des grands modèles de langage via des workflows de diagnostic prédéfinis. L'approche déterministe aide les ingénieurs à enquêter sur les incidents de production en générant des évaluations structurées des causes profondes, réduisant ainsi le temps d'acquisition de connaissances et le temps de récupération tout en maintenant les humains dans la boucle pour la validation.
Expedia Group a présenté le Service Telemetry Analyzer (STAR), une plateforme d'observabilité assistée par IA qui aide les ingénieurs à enquêter sur les incidents de production en analysant les données de télémétrie des services et en générant des évaluations structurées des causes profondes. Le système suit un flux de travail déterministe plutôt que d'utiliser des agents IA autonomes : il collecte les données de télémétrie, effectue une analyse avec des invites spécifiques au domaine, agrège les résultats et produit un rapport avec les causes profondes potentielles et les prochaines étapes suggérées. STAR est implémenté en tant qu'application FastAPI intégrée à Datadog pour les métriques et à une passerelle d'IA générative interne pour l'accès aux grands modèles de langage (LLM). Il utilise l'enchaînement d'invites pour exécuter plusieurs analyses spécialisées avant de générer un diagnostic consolidé. La plateforme se concentre sur la télémétrie d'infrastructure standardisée provenant de services basés sur Kubernetes et d'applications JVM, y compris des métriques telles que le débit des requêtes, la latence, les taux d'erreur, l'utilisation du processeur et de la mémoire, les redémarrages de conteneurs et l'utilisation du tas Java. Expedia a remplacé les tâches en arrière-plan de FastAPI par une architecture Celery asynchrone utilisant Redis comme courtier et backend de résultats pour gérer les opérations intensives en entrées-sorties et les limites de débit. STAR est utilisé pour l'enquête sur les incidents de production, l'analyse post-incident, le dépannage Kubernetes et le diagnostic de la mémoire JVM. Les projets futurs incluent l'ajout d'informations sur les dépendances entre services, l'intégration de l'outil Model Context Protocol (MCP) et des interfaces conversationnelles. La gestion et l'évaluation des invites sont assurées par Langfuse.
Source: InfoQ 中国 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches