Défaillances des agents d'IA : pourquoi les tableaux de bord sont verts mais les agents mentent pendant des jours
Cloud.ru
La surveillance classique ne détecte pas les défaillances des agents d'IA car ils se dégradent progressivement, sans planter. Pour détecter les problèmes, les équipes doivent tracer les cycles de raisonnement, mesurer des métriques de qualité agentiques, utiliser une évaluation LLM-en-tant-que-juge, versionner les prompts et écrire la télémétrie vers deux destinations dès le premier jour.
Les agents IA échouent différemment des services traditionnels : ils ne plantent pas, mais se dégradent lentement, rendant les mesures standard de disponibilité et de taux d'erreur inutiles. Les agents prennent des décisions non déterministes à chaque étape, de sorte que les défaillances surviennent dans les cycles de raisonnement plutôt que dans les réponses finales. Pour atteindre l'observabilité, les équipes doivent tracer l'intégralité du cycle de raisonnement avec un identifiant de trace unique, mesurer des métriques au niveau de l'agent telles que la précision de sélection des outils et le taux d'achèvement des objectifs, évaluer un échantillon de réponses en utilisant un LLM comme juge, versionner les invites (prompts) dans Git, et écrire la télémétrie vers deux destinations (par exemple, un fournisseur de cloud et des outils spécialisés) pour éviter la dépendance vis-à-vis d'un fournisseur. Ces pratiques sont essentielles avant même que les outils spécialisés d'observabilité des agents ne soient matures.
Source: Habr — хаб ИИ —
original
