智能体应用 🇺🇸 01.08.2026 08:02

利用亚马逊云科技Bedrock AgentCore可观测性优化生产环境中的智能体

Amazon/AWSAmazon/AWS
这篇来自亚马逊云科技机器学习博客的文章,探讨了人工智能智能体在投入生产后出现的性能与内存问题。文章指导如何结合亚马逊云科技CloudWatch使用亚马逊云科技Bedrock AgentCore可观测性,以定位瓶颈和内存泄漏,并提供了监控与优化的最佳实践。
本文是关于调试AI智能体系列文章的第二部分,重点讨论那些功能正常但性能不佳的智能体。场景三涉及性能瓶颈:其症状包括延迟逐渐增加,P95响应时间超过阈值,但错误率较低。为了诊断,需要查询CloudWatch以获取高延迟调用,通过OpenTelemetry追踪分析请求时间线,并检查内存检索延迟(应低于200毫秒)以及工具调用延迟。根本原因包括工具执行缓慢、生成的令牌过多以及串行处理。修复措施包括缓存、连接池、数据库索引、优化提示词以使其简洁,以及并行运行独立的工具调用。场景四则针对长时间运行会话中的内存问题,其中内存使用量无限制增长,导致令牌限制和会话失败。为了识别,需要查询长时间会话并具有高内存使用率,检查内存提取模式,并检查是否存在提取失败。根本原因包括配置错误;修复措施涉及内存整合、命名空间模板以及设置eventExpiryDuration。文章最后介绍了生产环境的最佳实践:全面的监控、CloudWatch警报、仪表板,以及使用AgentCore评估器和洞察工具进行主动监控。
来源: AWS ML blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻