Optimiser les agents de production avec l'observabilité Amazon Bedrock AgentCore
Amazon/AWS
Cet article du blog AWS ML aborde les problèmes de performance et de mémoire des agents IA après leur passage en production. Il fournit des conseils sur l'utilisation de l'observabilité Amazon Bedrock AgentCore avec Amazon CloudWatch pour identifier les goulots d'étranglement et les fuites de mémoire, et propose des bonnes pratiques pour la surveillance et l'optimisation.
Cet article est la deuxième partie d'une série sur le débogage des agents IA, qui se concentre sur les agents qui fonctionnent correctement mais ont de mauvaises performances. Le scénario 3 couvre les goulots d'étranglement de performance : les symptômes incluent une augmentation progressive de la latence, des temps de réponse P95 dépassant les seuils, mais de faibles taux d'erreur. Pour diagnostiquer, interrogez CloudWatch pour les invocations à haute latence, analysez la chronologie des requêtes via les traces OpenTelemetry, et vérifiez la latence de récupération mémoire (qui devrait être inférieure à 200 ms) et la latence d'invocation des outils. Les causes racines incluent l'exécution lente des outils, la génération excessive de jetons et le traitement séquentiel. Les correctifs incluent la mise en cache, le regroupement de connexions, l'indexation de bases de données, l'optimisation des invites pour la brièveté et l'exécution parallèle des appels d'outils indépendants. Le scénario 4 aborde les problèmes de mémoire dans les sessions de longue durée, où l'utilisation de la mémoire croît de manière illimitée, ce qui entraîne des limites de jetons et des échecs de session. Pour identifier, interrogez les sessions longues avec une utilisation mémoire élevée, examinez les modèles d'extraction mémoire et vérifiez les échecs d'extraction. Les causes racines incluent des paramètres mal configurés ; les correctifs impliquent la consolidation de la mémoire, les modèles d'espace de noms et la définition de eventExpiryDuration. L'article conclut avec les meilleures pratiques de production : instrumentation complète, alarmes CloudWatch, tableaux de bord et utilisation d'AgentCore Evaluators et Insights pour une surveillance proactive.
Source: AWS ML blog —
original
