Amazon Bedrock AgentCore : Détection des défaillances cachées des agents IA
Amazon/AWS
Amazon Bedrock a lancé l'optimisation AgentCore, qui identifie les défaillances « silencieuses » des agents IA – des erreurs de comportement non détectées par les métriques standards (99% de succès, zéro erreur). L'outil analyse les traces de sessions, regroupe les défaillances (11 types, dont hallucinations, actions incorrectes) et indique la cause racine, en proposant des correctifs priorisés. Au-delà des défaillances, AgentCore montre la répartition des intentions des utilisateurs et les stratégies réelles de l'agent.
Amazon Bedrock a dévoilé l’optimisation AgentCore, conçue pour détecter les défaillances comportementales des agents d’IA invisibles lors d’un suivi standard : le système affiche 99 % de réussite, une latence nulle et aucune erreur, mais les clients se plaignent de résultats incorrects (par exemple, une modification de commande non exécutée ou une étape de validation manquée). AgentCore analyse les traces de sessions collectées via CloudWatch et structure les défaillances selon une taxonomie de 11 catégories (hallucinations, actions incorrectes, non-respect des instructions, erreurs d’orchestration, etc.), détectant même celles qui ne génèrent aucun signal d’erreur. Le système regroupe les défaillances par centaines de sessions, identifie la cause racine (par exemple, l’invention de données financières sans appel d’outils) et classe les groupes par proportion de sessions affectées, afin que le développeur puisse voir immédiatement quel problème touche 30 % du trafic et lequel n’affecte que trois sessions. AgentCore regroupe également les requêtes utilisateur (montrant la part de trafic pour les scénarios ciblés, partiellement pris en charge et imprévus) et extrait des résumés exploitables pour chaque session, mettant en évidence les écarts entre le comportement attendu et réel de l’agent. La configuration inclut le choix des types d’analyse (défaillances, intentions, exécution), l’indication de la source des traces (agent depuis AgentCore ou directement CloudWatch) et la planification (ponctuelle ou régulière). Exemple : un agent de tendances de marché a halluciné des données financières sans utiliser d’outils dans 1 session sur 10 ; la correction a été de renforcer le prompt système. Ces insights déplacent le modèle d’observabilité d’une visualisation réactive des traces vers une détection proactive de schémas, permettant de corriger d’abord les problèmes les plus critiques.
Source: AWS ML blog —
original
